Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 May 27

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
но мне нужен русский
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
и отсюда вопрос, что лучше всего работает с русским языком для этого)
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
в Multilingual BERT есть русский
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
и вот на сайте Русвекторс есть ELMo
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
о, и он умеет считать близость слов, верно?
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
нет, сам BERT умеет только переводить слова в вектора
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
а вы уже расстояние между векторами можете посчитать с помощью Numpy например
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Sasha Zhu
полагаю, что в моем случае будет лучше работать контекстуальная
На моих замерах русскоязычный fasttext работал лучше, чем rubert.
И удивительно даже, что не только на моих, но и на некоторых диппавловских 🤔
И он точно быстрее)
fasttext'ы на сайте rusvectores в стандартном формате библиотеки gensim, который отлично задокументирован.
Так что я бы с FT начал, а берт, элмо и прочие толстые нейронки уже потом докручивал бы.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
BERT возвращает вектор фразы целиком, а отдельные слова, там надо заморочиться, если нужны именно слова, то ELMo удобнее
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
ага, спасибо большое
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
David (ddale) Dale
На моих замерах русскоязычный fasttext работал лучше, чем rubert.
И удивительно даже, что не только на моих, но и на некоторых диппавловских 🤔
И он точно быстрее)
fasttext'ы на сайте rusvectores в стандартном формате библиотеки gensim, который отлично задокументирован.
Так что я бы с FT начал, а берт, элмо и прочие толстые нейронки уже потом докручивал бы.
а можно чуть побольше об этом?
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
David (ddale) Dale
На моих замерах русскоязычный fasttext работал лучше, чем rubert.
И удивительно даже, что не только на моих, но и на некоторых диппавловских 🤔
И он точно быстрее)
fasttext'ы на сайте rusvectores в стандартном формате библиотеки gensim, который отлично задокументирован.
Так что я бы с FT начал, а берт, элмо и прочие толстые нейронки уже потом докручивал бы.
и да, буду пробовать, спасибо!
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
Elena
BERT возвращает вектор фразы целиком, а отдельные слова, там надо заморочиться, если нужны именно слова, то ELMo удобнее
учту, спасиб
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Sasha Zhu
вот тут как раз начинаются вопросы :)
у меня есть задача: найти к слову условные 20 наиболее близких, и просчитать близость к этим 20 из списка своих
для такой задачи нет смысла заморачиваться с берт, можно взять фасттекст, загрузить его через Gensim и там есть уже встроенная фунция посчитать близость
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
Elena
для такой задачи нет смысла заморачиваться с берт, можно взять фасттекст, загрузить его через Gensim и там есть уже встроенная фунция посчитать близость
супер, спасибо. то, что надо было выяснить
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Sasha Zhu
а можно чуть побольше об этом?
Бери любой fasttext из четырёх отсюда, и загружай вот в этот класс.
import gensim
big_model = gensim.models.fasttext.FastTextKeyedVectors.load('path-to-original-model')
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Sasha Zhu
и да, буду пробовать, спасибо!
А ещё я недавно научился сжимать модели fasttext до пары десятков мегабайт, если вдруг это кому-то зачем-то нужно 🙃
источник

SZ

Sasha Zhu in NLP_RU - Natural Language Processing & Text Mining
David (ddale) Dale
А ещё я недавно научился сжимать модели fasttext до пары десятков мегабайт, если вдруг это кому-то зачем-то нужно 🙃
Это твоя статья на хабре была?)
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Sasha Zhu
Это твоя статья на хабре была?)
угу
источник