Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 August 14

DD

David Dale in NLP_RU - Natural Language Processing & Text Mining
Враг Дурова
Будет ли решением сохранить модель на следующие использования? будет ли выдаваться одинаковые результаты?
Да, будут одинаковые.
Но я всё равно очень рекомендую random_state указывать. Это просто хорошая привычка, как руки мыть)
источник

В

Враг Дурова... in NLP_RU - Natural Language Processing & Text Mining
David Dale
Да, будут одинаковые.
Но я всё равно очень рекомендую random_state указывать. Это просто хорошая привычка, как руки мыть)
так и не понял как его ставить, гугл не помог
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
при определении модели RF как один из параметров
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
источник

MT

Michael Tkach in NLP_RU - Natural Language Processing & Text Mining
Враг Дурова
Там текст и довольно большой. Просто скрыл для удобства чтения
Чувак, если в пастбине полная копипаста твоего кода, то у тебя обучение происходит только на тексте из первого файла ( строка 20 в pastebin . com / VnayePGA )
источник

В

Враг Дурова... in NLP_RU - Natural Language Processing & Text Mining
Michael Tkach
Чувак, если в пастбине полная копипаста твоего кода, то у тебя обучение происходит только на тексте из первого файла ( строка 20 в pastebin . com / VnayePGA )
для каждого файла из категорий:
открыть файл текстов с категорями как цель:
 читать цель и добавить в тренировочную дату


каждый файл категории имеет вес в 10-15 мегабайт, разделенных между собой двумя энтерами
источник

В

Враг Дурова... in NLP_RU - Natural Language Processing & Text Mining
то есть все тексты в одном файле,  они разделены между собой
источник

DD

David Dale in NLP_RU - Natural Language Processing & Text Mining
Враг Дурова
то есть все тексты в одном файле,  они разделены между собой
в строке 20 ты на каждой итерации считываешь cats[0], т.е. только первый файлик. Так что Михаил прав)
источник

MT

Michael Tkach in NLP_RU - Natural Language Processing & Text Mining
Для каждой категории тьі открьіваешь "trains/00.txt", читаешь одни и те же первьіе 700 строк и говоришь, что они есть текста для твоей категории
источник

DD

David Dale in NLP_RU - Natural Language Processing & Text Mining
Теперь понятно, почему модель такая неуверенная - у неё для всех 7 классов одинаковые примеры были 🙃
источник

В

Враг Дурова... in NLP_RU - Natural Language Processing & Text Mining
вот оно что
источник

MT

Michael Tkach in NLP_RU - Natural Language Processing & Text Mining
В итоге после обучения на любой текст в идеале должно отдавать одинаковьіе скорьі
источник

DD

David Dale in NLP_RU - Natural Language Processing & Text Mining
Michael Tkach
В итоге после обучения на любой текст в идеале должно отдавать одинаковьіе скорьі
Должно было, но randomForest их поресэмплил случайно, и получились неодинаковые
источник

MT

Michael Tkach in NLP_RU - Natural Language Processing & Text Mining
Но они немного разньіе из-за рандомной инициализации, о которой говорилось вьіше
источник

MT

Michael Tkach in NLP_RU - Natural Language Processing & Text Mining
David Dale
Должно было, но randomForest их поресэмплил случайно, и получились неодинаковые
да
источник

В

Враг Дурова... in NLP_RU - Natural Language Processing & Text Mining
Спасибо! я бы не догадался_)
источник

В

Враг Дурова... in NLP_RU - Natural Language Processing & Text Mining
заработало, вот где подвох
источник
2020 August 17

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
источник

rd

rus dacent in NLP_RU - Natural Language Processing & Text Mining
#НейронныеСети
[Russian]

Title: Обработка естественного языка в действии

Author: Хобсон Лейн, Ханнес Хапке, Коул Ховард
Year: 2020
Pages: 576
ISBN: 978-5-4461-1371-2
Screenshot: https://t.me/bzd_screenshots/5816

Description: Эта книга станет вашим руководством по созданию программ, способных распознавать и интерпретировать человеческий язык. В издании рассказано, как с помощью готовых пакетов на языке Python извлекать из текста смыслы и адекватно ими распоряжаться. В книге дается расширенная трактовка традиционных методов NLP, что позволит задействовать нейронные сети, современные алгоритмы глубокого обучения и генеративные приемы при решении реальных задач, таких как выявление дат и имен, составление текстов и ответов на неожиданные вопросы.

@bzd_channel
источник

rd

rus dacent in NLP_RU - Natural Language Processing & Text Mining
источник