Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 July 06

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Ну, вот только я так понимаю, их проще не на лету формировать
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Alex Konst
Можно tfidf просто взять для начала и кластеризовать Birch'ем, который сам подберет ~оптимальное количество кластеров
Так у меня нет просто документов. У меня просто вектор из строк (в примере одна строчка - это одна строка).
источник

AK

Alex Konst in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
Так у меня нет просто документов. У меня просто вектор из строк (в примере одна строчка - это одна строка).
одна строчка - один документ:)
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Alex Konst
одна строчка - один документ:)
Хм.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Хм. Звучит логично.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
Приношу глубочайшие извинения тем, кого задену очень базовым вопросом.

У меня есть список строк. Их полторы тысячи. Стоп-слова я позже уберу. Хочу кластеризовать строки по темам. На ум приходит просто взять и кластеризовать их через расстояние Левентшейна, а потом мозгом уже посмотреть темы этих кластеров. Можно ли как-то получше сделать?
я бы попробовала векторы fasttext, посчитать среднее значение для строки или сумму простую, но обычно среднее делается, и попробовать разные алгоритмы кластеризации, от самого простого типа k-means и GMM и сколько найдете в sklearn или другой библиотеке
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
надо примерно знать, сколько тем может быть во всем списке, сколько кластеров делать, будут ли темы постоянные, или что-то новое будет появляться
источник
2020 July 09

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Коллеги, я в @bigdata_ru уже сообщал неоднократно, а вот тут вообще ни разу не говорил, что у нас есть канал с вакансиями: @datasciencejobs
Если у кого есть интересные вакансии - присылайте @musit :)
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
какие хорошие зарплаты у нлп-инженеров в Тинькоф банке...
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
:)
источник
2020 July 23

К

Константин in NLP_RU - Natural Language Processing & Text Mining
какие простые готовые решения есть для определения пола по ФИО?
источник

D

D in NLP_RU - Natural Language Processing & Text Mining
surname[-1]=='а'
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
Хаха
источник

M

Maria in NLP_RU - Natural Language Processing & Text Mining
D
surname[-1]=='а'
лучше отчество тогда
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
D
surname[-1]=='а'
И совсем круто

if firstname[-1] in ['a', 'я']
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
мне кажется только по отчеству можно определить
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
фамилия может быть какая угодно
источник

M

Maria in NLP_RU - Natural Language Processing & Text Mining
мне кажется, что если совсем простое решение, то отчество + какой-нибудь словарь имён (не все случаи покроет, но пишется быстро и работает сносно)

есть ли гендерные маркеры в какой-нибудь Наташе, не знаю (
источник

Р

Руслан in NLP_RU - Natural Language Processing & Text Mining
Elena
мне кажется только по отчеству можно определить
А как же отчества типа "... оглы" или отсутствие отчества?
источник

M

Maria in NLP_RU - Natural Language Processing & Text Mining
Руслан
А как же отчества типа "... оглы" или отсутствие отчества?
так там вроде тоже оглы vs кызы
источник