Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 June 03

E

Elena in NLP_RU - Natural Language Processing & Text Mining
а с каким алгоритмом?
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Elena
а с каким алгоритмом?
LDA
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Сейчас ещё прочитал, что советую удалять n-граммы, если какой-то процент слов в них является стоп-словами. По типу "to be" и так далее.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
тогда надо удалять на этапе препросессинга текста вместе с пунктуацией
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
вообще я бы делала проще, очистить текст, нормализовать по максимуму например сделать лемматизацию или стемминг и в ЛДА
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Elena
тогда надо удалять на этапе препросессинга текста вместе с пунктуацией
Да, я тоже так думал делать, но тогда могут возникнуть ложные нграммы же. И это меня смущает.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
что значит, ложные?
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Elena
что значит, ложные?
Например, вот у меня список стоп-слов для русского. И была бы триграмма "никогда не хотел", а получится какая-нибудь "белый не хотел".
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
ну и что? это неважно
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
если текст всегда предобрабатывается одинаково, то статистика будет однородно считаться
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Евгений Томилов
Например, вот у меня список стоп-слов для русского. И была бы триграмма "никогда не хотел", а получится какая-нибудь "белый не хотел".
Если у тебя такой список стоп-слов, и ты удаляешь N-граммы со стоп-словами, то "никогда не хотел" тоже будет удалено :)
Ну и вообще, многие так называемые "стоп-слова" как раз и создают всю прелесть устойчивых выражений.
Поэтому лично я не удалял бы ничего.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Вот!
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Что же делать. =D
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
в ЛДА стоп слова создают много шума
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
они не дают никакой информации о теме
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Ну, я всё равно учусь, так что попробую все варианты.
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Насколько я знаю, удаление "стоп-слов" придумали в information retrieval (то бишь для поисковиков), чтобы не матчить по ним запросы с документами - иначе было бы слишком много ложных матчей.
В большинстве других задач стоп-слова не очень вредны, так что если их не удалять, кажется, сильно хуже не будет.
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Elena
они не дают никакой информации о теме
Ну и что? Если они присутствуют в каждой теме, то алгоритм сам научится их игнорировать.
источник

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Elena
они не дают никакой информации о теме
Хотя вообще-то некоторые из них очень даже дают.  
Например, как часто ты видела в научных статьях или, скажем, в юридических актах слово "я"? 🙃
источник