Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 June 03

D(

David (ddale) Dale in NLP_RU - Natural Language Processing & Text Mining
Или, например, слово "два". Само по себе оно не очень информативное, и слово "стул" не очень информативное, а вот в рамках одной биграммы они означают нечто большее)
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
еще для ЛДА есть варианты удалять все слова короче четырех знаков, или все слова с частотой выше определенного порога
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
но это все на усмотрение. Надо пробовать и сравнивать
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
вы нам главное расскажите что получилось в итоге
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
а то мы тут советуем и неизвестно помогает это или нет :)
источник
2020 June 04

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Спасибо, что советуете, на редкость дружелюбные к новичкам люди тут.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Пока что я помучался с нехваткой оперативки, её всего лишь 32Гб, и удалил триграммы, которые начинаются или заканчиваются на стоп-слово. Думаю, так будет окей.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Как же мы раньше тренировали ЛДА на 2 гб оперативки? :)
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Elena
Как же мы раньше тренировали ЛДА на 2 гб оперативки? :)
Для ЛДА хватило 2Гб оперативки. У меня корпус огромный просто.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
тогда тем более имеет смысл убирать стоп слова и все малозначительное, все будет работать быстрее
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Elena
тогда тем более имеет смысл убирать стоп слова и все малозначительное, все будет работать быстрее
Убрал. Темы получаются несколько малоосмысленными с человеческой точки зрения, но я ещё погоняю.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Зависит от количества тем, от длины текстов, от количества текстов, от много чего
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
А я верно понимаю, что, если у меня, скажем, есть 20 текстов, и я хочу сравнить у них самые важные n-граммы, то я собираю их в корпус все, считаю tf-idf и потом беру для каждого текста по, скажем, 5 n-грамм с самым высоким tf-idf. И это уже имеет какой-никакой смысл.
источник

ЕТ

Евгений Томилов... in NLP_RU - Natural Language Processing & Text Mining
Elena
Зависит от количества тем, от длины текстов, от количества текстов, от много чего
Ну, у меня 27 художественных текстов одного жанра. Я пытаюсь из них вытащить темы. Постепенно всё осмысленнее становится.
источник
2020 June 13

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Подскажите пожалуйста, у меня есть модель random forest она работает весьма не плохо, но периодически делает "выбросы". Очевидно, это связано с тем как работает лес, у меня есть мысль по верх нее поставь ещё логистическую регрессию. Думаю есть ещё варианты нивелировать или аппроксимировать выбросы леса.
Не подскажете?
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
@gwenywere вы не против, если я вам дам полномочия модератора? :) за существенный вклад в развитие группы и за помощь по теме
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Я не против :) спасибо!
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Cucusenok
Подскажите пожалуйста, у меня есть модель random forest она работает весьма не плохо, но периодически делает "выбросы". Очевидно, это связано с тем как работает лес, у меня есть мысль по верх нее поставь ещё логистическую регрессию. Думаю есть ещё варианты нивелировать или аппроксимировать выбросы леса.
Не подскажете?
на каких данных?
источник

C

Cucusenok in NLP_RU - Natural Language Processing & Text Mining
Тексты - стоп слова, токенайзер, лемматизированные и в вектор
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
а задача какая? классификация?
источник