Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 May 31

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Угу
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Загуглил
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
В обработке естественного языка контекст тоже играет большую роль
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Любой вид группового общения
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
В данном случае, семантический смысл
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Вектора должны быть рядом)
источник
2020 June 02

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Хочу в целях образования сделать свой POS-теггер и читаю очень мудрые статьи, однако встал вопрос.
Я верно понимаю, что, основываясь на примере из этой статьи, я должен взять текст размеченный, разбить его на триграммы и переделать в датасет из указанных фич? Потом я запускаю какой-нибудь катбуст, делаю функцию разбиения на триграммы новых текстов, и модель мне волшебно предсказывает части речи для новых слов.

Но что в таком случае делать, если в корпусе никогда не было такого слова? Можно смотреть только по суффиксам-префиксам, но... мне не хватает пока знаний. Что можно ещё почитать?
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Почитай про fasttext (все слова, включая новые, просчитываются из эмбеддингов буквенных n-грам), посмотри видос про модели в spacy (там есть трюки типа использования "shape"- общего вида слова с учётом капитализации символов). И ещё можно про BPE-словари, которые любое слово разбивают на известные токены.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
David (ddale) Dale
Почитай про fasttext (все слова, включая новые, просчитываются из эмбеддингов буквенных n-грам), посмотри видос про модели в spacy (там есть трюки типа использования "shape"- общего вида слова с учётом капитализации символов). И ещё можно про BPE-словари, которые любое слово разбивают на известные токены.
Спасибо!
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
Хочу в целях образования сделать свой POS-теггер и читаю очень мудрые статьи, однако встал вопрос.
Я верно понимаю, что, основываясь на примере из этой статьи, я должен взять текст размеченный, разбить его на триграммы и переделать в датасет из указанных фич? Потом я запускаю какой-нибудь катбуст, делаю функцию разбиения на триграммы новых текстов, и модель мне волшебно предсказывает части речи для новых слов.

Но что в таком случае делать, если в корпусе никогда не было такого слова? Можно смотреть только по суффиксам-префиксам, но... мне не хватает пока знаний. Что можно ещё почитать?
в этом же вся идея машинного обучения - предсказывать класс новых текстов на основе "старых". Чем больше и разнообразнее тренировочные данные, тем лучше модель будет классифицировать новые слова, даже ни разу их "не видев". Ошибки будут всегда, например. 10% ошибок это очень хороший результат
источник

m

mel kaye in NLP_RU - Natural Language Processing & Text Mining
всем привет. существуют попытки описать естественные языки аналитически?
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
mel kaye
всем привет. существуют попытки описать естественные языки аналитически?
погугли "порождающие грамматики", например
источник

m

mel kaye in NLP_RU - Natural Language Processing & Text Mining
а что можно почитать для ознакомления с темой?
источник

m

mel kaye in NLP_RU - Natural Language Processing & Text Mining
и я так понял эти модели не очень часто на практике используются?
источник

וק

ולדימיר קון... in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
Хочу в целях образования сделать свой POS-теггер и читаю очень мудрые статьи, однако встал вопрос.
Я верно понимаю, что, основываясь на примере из этой статьи, я должен взять текст размеченный, разбить его на триграммы и переделать в датасет из указанных фич? Потом я запускаю какой-нибудь катбуст, делаю функцию разбиения на триграммы новых текстов, и модель мне волшебно предсказывает части речи для новых слов.

Но что в таком случае делать, если в корпусе никогда не было такого слова? Можно смотреть только по суффиксам-префиксам, но... мне не хватает пока знаний. Что можно ещё почитать?
Рекомендую все же в целях образования взять и сделать обычный POS tagger используя HMM(hidden Markov models) а потом уже будет понятно как что, использовать то что посоветовали выше и прочее. (Можно использовать hmmlearn который когда то был частью sklearn)
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
mel kaye
и я так понял эти модели не очень часто на практике используются?
Для моделей "общего пользования" - да, особо не используются, потому что очень-очень много правил нужно писать, особенно в языках типа русского, где слова сильно изменяются и порядок не фиксирован.
Иногда, впрочем, грамматики используют в индустрии, чтобы описать какое-то небольшое подмножество языка. Например, запросы к голосовому помощнику на определённую тему.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
ולדימיר קון
Рекомендую все же в целях образования взять и сделать обычный POS tagger используя HMM(hidden Markov models) а потом уже будет понятно как что, использовать то что посоветовали выше и прочее. (Можно использовать hmmlearn который когда то был частью sklearn)
Спасибо!
источник
2020 June 03

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Не совсем понимаю насчёт удаления стоп слов при условии использования n-грамм.
С одной стороны можно удалить стоп-слова ДО создания n-грамм, но тогда логика сломается и будет чушь какая-то. Так что это, судя по тому, что я прочитал, не пойдёт.
С другой стороны можно удалить n-граммы со стоп-словами. Но такое ощущение, что это тоже сломает логику.
В статьях разные мнения, но чаще всего вообще не удаляют стоп-слова, по всей видимости, их негативный эффект нивелируется, если сортировать по tf-idf.
Всё ли верно я говорю?
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
а какая задача? есть задачи, для которых надо удалять стоп-слова, а есть нет
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Elena
а какая задача? есть задачи, для которых надо удалять стоп-слова, а есть нет
В данный момент - тематическое моделирование.
источник