Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 July 27

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Lev Lunev
Ребят, всем снова привет!

А я правильно понимаю, что тренировка NER по сути учит модель понимать сущность из контекста?

То есть, если до этого мы не показывали ей какое-то имя, но тренировали её на других именах, то она сможет его найти?
Так и есть. Плюс любая информация,которая поможет. Поэтому потом в процессе использования зависит, на каких текстах была обучена модель и на каких используется.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Грубо говоря если у вас неаккуратный текст, с опечатками в заглавных буквах, то модель ничего не определит. Или если было обучено на новостях, а применяется на документы юридического толка, то тоже будут проблемы.
источник
2020 July 28

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
https://nlpwithfriends.com/ - вдруг кому-нибудь из вас будет интересно
источник

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Спасибо!)
источник

I

Ilyas in NLP_RU - Natural Language Processing & Text Mining
В ссылках на прошедшие семинары (презентации и видео), ролик музыкальный и отрывок фильма с хоббитами))
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
ну небось такой lorem ipsum, но если совсем смущает, можно спросить :)
источник
2020 July 29

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Всем спасибо, у меня получилось 😂😂😂

Пока есть пара косяков в трейнинг датах, из-за чего косяки в модели, но я знаю, как исправить))

Скажите, кто-нибудь Prodigy пользуется?
источник
2020 July 30

🕵

🕵🏻 Макс in NLP_RU - Natural Language Processing & Text Mining
Платный?
источник

A

Alexey in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
Приношу глубочайшие извинения тем, кого задену очень базовым вопросом.

У меня есть список строк. Их полторы тысячи. Стоп-слова я позже уберу. Хочу кластеризовать строки по темам. На ум приходит просто взять и кластеризовать их через расстояние Левентшейна, а потом мозгом уже посмотреть темы этих кластеров. Можно ли как-то получше сделать?
Метод Latent Dirichlet Allocation изначально направлен на решение именно этой задачи. Но с соответствующими особенностями : количество групп или кластеров надо подбирать экспериментально. При инициализации генератора случайных чисел разными начальными значениями итоговое наполнение групп может отличаться. Поэтому необходимо экспериментировать. Строки из картинки выглядят как имеющие шанс правдоподобно кластеризоваться.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Alexey
Метод Latent Dirichlet Allocation изначально направлен на решение именно этой задачи. Но с соответствующими особенностями : количество групп или кластеров надо подбирать экспериментально. При инициализации генератора случайных чисел разными начальными значениями итоговое наполнение групп может отличаться. Поэтому необходимо экспериментировать. Строки из картинки выглядят как имеющие шанс правдоподобно кластеризоваться.
Понял, спасибо!
источник

AB

Anya Bataeva in NLP_RU - Natural Language Processing & Text Mining
Alexey
Метод Latent Dirichlet Allocation изначально направлен на решение именно этой задачи. Но с соответствующими особенностями : количество групп или кластеров надо подбирать экспериментально. При инициализации генератора случайных чисел разными начальными значениями итоговое наполнение групп может отличаться. Поэтому необходимо экспериментировать. Строки из картинки выглядят как имеющие шанс правдоподобно кластеризоваться.
Читала, что классическая реализация LDA плохо кластеризует короткие тексты (размера твиттов). Тематическое моделирование — это, вроде, та постановка задачи, но не классический LDA

Я бы потестила методы из этого треда:

https://github.com/bigartm/bigartm/issues/428
источник

DP

Dina Pisarevskaya in NLP_RU - Natural Language Processing & Text Mining
Я бы предложила начать с простого бейзлайна: sklearn k-means на сумке слов, подобрав оптимальное количество кластеров с помощью elbow или silhouette. На таком небольшом датасете, может, этого и будет достаточно.
источник
2020 August 03

P

Pi in NLP_RU - Natural Language Processing & Text Mining
всем привет, столкнулся с задачей формирования оглавления документов(юридических). вопрос-есть ли стандартные(классические/популярные) подходы по решению подобного класса задач? насколько я понимаю, наиболее близкая к этой задаче-text segmentation
источник

IS

I Sh in NLP_RU - Natural Language Processing & Text Mining
Pi
всем привет, столкнулся с задачей формирования оглавления документов(юридических). вопрос-есть ли стандартные(классические/популярные) подходы по решению подобного класса задач? насколько я понимаю, наиболее близкая к этой задаче-text segmentation
суммаризация?
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
классификация скорее
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Хотя смотря с какой стороны идти, если оглавление в самих документах указано, то суммаризация
источник

P

Pi in NLP_RU - Natural Language Processing & Text Mining
I Sh
суммаризация?
кажется, да. в тексте должны присутствовать названия статей, номера пунктов и подпунктов, приложения и тд
источник

IS

I Sh in NLP_RU - Natural Language Processing & Text Mining
ааа... вон какое оглавление. Ну, а если просто взять и извлечь названия этих статей. Статьи же как-то размечены, например, word
источник

IS

I Sh in NLP_RU - Natural Language Processing & Text Mining
или в ПДФ тоже название будет как-то отличаться от основного текста
источник

P

Pi in NLP_RU - Natural Language Processing & Text Mining
I Sh
ааа... вон какое оглавление. Ну, а если просто взять и извлечь названия этих статей. Статьи же как-то размечены, например, word
работа с  html, ну да, под разметкой имеются ввиду отступы и тд?
источник