Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 July 06

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Cucusenok
Мульти или один?
Не понимаю вопроса, можно как-то перефразировать?
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
И какие нужны кластеры?
Множественная классификация или бинарная?
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Cucusenok
И какие нужны кластеры?
Множественная классификация или бинарная?
У меня нет задачи классификации. Просто список строк (на картинке сэмпл из него). И надо их разложить по темам.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
И этого достаточно будет.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Ну, то есть, тут навскидку видно, что есть сварщики, есть повара, есть кондитеры.
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
Ну, то есть, тут навскидку видно, что есть сварщики, есть повара, есть кондитеры.
Ну я и спрашиваю. Я бы ради эксперимента через pymorpy прогнал на наличие сущностей ну и к лемме привел
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Но у тебя там ещё гео будет
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Cucusenok
Ну я и спрашиваю. Я бы ради эксперимента через pymorpy прогнал на наличие сущностей ну и к лемме привел
К лемме я уже привёл, да. А "спб" я уберу, пожалуй, потому что тут везде по спб запросы.
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
если не нужно, то оберни в pymorpy и забирай только сущности. Если по быстрому, можно просмотреть по частоте встречаемости слов сможешь убрать общие. Это уже существенно упростит.
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Ну, спб, цена etc
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
К лемме я уже привёл, да. А "спб" я уберу, пожалуй, потому что тут везде по спб запросы.
Ну к лемме и к существительному. Напр., у тебя кулинарный, а на выходе должна быть кулинария?
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Cucusenok
Ну к лемме и к существительному. Напр., у тебя кулинарный, а на выходе должна быть кулинария?
Не, именно кулинарный.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Ага, понял.
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Ну и удостоверение электрика
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Я сейчас думаю векторизовать запросы через какой-нибудь вордвек.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
И натравить k-means потом.
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Тоже об этом подумал
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Но с вордвеком не работал ещё особо, надо посмотреть, можно ли векторизовать сразу несколько слов. Навскидку кажется, что это не так работает. Раньше работал только с тематическим моделированием нескольких документов.
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Меня именно "удостоверение электрика" сейчас напрягло.
Можно в ворд2век, но все равно нужно будет взять основу типа удостоверения, а на выходе сделать древовидную структуру.
Но тут уже нужно понимать твою конечную задачу.
источник

AK

Alex Konst in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
Приношу глубочайшие извинения тем, кого задену очень базовым вопросом.

У меня есть список строк. Их полторы тысячи. Стоп-слова я позже уберу. Хочу кластеризовать строки по темам. На ум приходит просто взять и кластеризовать их через расстояние Левентшейна, а потом мозгом уже посмотреть темы этих кластеров. Можно ли как-то получше сделать?
Можно tfidf просто взять для начала и кластеризовать Birch'ем, который сам подберет ~оптимальное количество кластеров
источник