Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2021 January 16

М

Михаил in NLP_RU - Natural Language Processing & Text Mining
Да видимо чисто по заголовкам)
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Если бы мы ориентировались только на заголовки, человечество перестало бы существовать
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Особенно читая "ИД Панорама", например
источник
2021 January 20

PZ

Pavel Zheltouhov in NLP_RU - Natural Language Processing & Text Mining
(извините)
источник

МВ

Михаил Воеводский... in NLP_RU - Natural Language Processing & Text Mining
Всем привет.
Какие библиотеки/инструменты для анализа типа текста (реклама/не реклама)?

Сейчас для этой задачи использую библиотеку nlpTools на php, но она не устраивает своей простотой, ибо при накоплении данных строит примитивную модель, в которой каждому слову присваивает вес, а при анализе только суммирует веса и выдает результат по максимальному значению. Связи слов между собой не сохраняет, не анализирует, никак не учитывает. Из-за этого точность определения получается очень низкой.

В идеале инструмент нужен на PHP/JS, но рассмотрю и другие языки, если освоение библиотеки не потребует "полуговодового" изучения.

Подскажите, какие есть инструменты, позволяющие решить задачу, учитывающие при обучении связи слов?
источник

rt

ros tel in NLP_RU - Natural Language Processing & Text Mining
Михаил Воеводский
Всем привет.
Какие библиотеки/инструменты для анализа типа текста (реклама/не реклама)?

Сейчас для этой задачи использую библиотеку nlpTools на php, но она не устраивает своей простотой, ибо при накоплении данных строит примитивную модель, в которой каждому слову присваивает вес, а при анализе только суммирует веса и выдает результат по максимальному значению. Связи слов между собой не сохраняет, не анализирует, никак не учитывает. Из-за этого точность определения получается очень низкой.

В идеале инструмент нужен на PHP/JS, но рассмотрю и другие языки, если освоение библиотеки не потребует "полуговодового" изучения.

Подскажите, какие есть инструменты, позволяющие решить задачу, учитывающие при обучении связи слов?
Поищите "Обработка естественного языка в действии
Хобсон Лейн, Ханнес Хапке, Коул Ховард"

В этой книжице
есть несколько вариантов бинарных классификаторов спам/не спам от самых простых к более продвинутым.
Правда python, но тут принцип понять, а там уж может аналогичное найдете на пыхе.
источник

МВ

Михаил Воеводский... in NLP_RU - Natural Language Processing & Text Mining
ros tel
Поищите "Обработка естественного языка в действии
Хобсон Лейн, Ханнес Хапке, Коул Ховард"

В этой книжице
есть несколько вариантов бинарных классификаторов спам/не спам от самых простых к более продвинутым.
Правда python, но тут принцип понять, а там уж может аналогичное найдете на пыхе.
Спасибо!
источник
2021 February 01

I

Ilya in NLP_RU - Natural Language Processing & Text Mining
Всем примет, может кто помочь с Трансофрмерским Аутодекодером с механизом внимания.

У меня есть весь код всего аутодекодера, нужно только маски заполнить, и я не очень понимаю модель и как их заполнить, эту пару строчек кода.
источник
2021 February 04

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Всем привет! Наш семинар возобновляет вещание. Приглашаем вас в четверг, 11 февраля, в 19-00.

Тема
:  "Spacy для NLP: прошлое, настоящее, будущее".

Докладчик:
Юрий Бабуров, CTO в компании ApRbot (обработка неструктурированных документов), создатель библиотек spaCy-Ru, python-readability и соавтор крупнейшего корпуса русской речи OpenSTT, преподаватель курса по нейросетям в магистратуре НГУ, соавтор курса https://dlcourse.ai

Аннотация:  Spacy для NLP: прошлое, настоящее, будущее.
Расскажу про задачи, которые решает пакет Spacy,
и про то, как он это делает. Морфология и лемматизация, NER,
синтаксический анализ, классификация. SOTA или скорость.

Семинар пройдет в онлайн-формате.

Ссылка на регистрацию

(!) Алгоритм регистрации: надо заполнить форму, ближе к семинару вам придет письмо с ссылкой на zoom и паролем.
источник
2021 February 11

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Дорогие коллеги! У нас есть для вас очень горячая вакансия для Middle/Senior Android Developer на стыке машинного обучения, data science и геймдева! Гибкие и очень хорошие условия для работы, реализации ваших навыков, и профессионального роста! Все подробности в нашем канале: https://t.me/datasciencejobs/382
источник

TN

Timofey Naumenko in NLP_RU - Natural Language Processing & Text Mining
Добрый день! Для дипломной работы нужно подобрать определенную задачу (уже решенную). Она должна соответствовать следующим характеристикам:
1) Должна иметь хорошее опубликованное решение, использующее Transformer
2) Обучение не дольше 4 GPU-дней (2080ti)
3) Отсутствие большого количества наворотов у около-sota решения.
4) Желательно чтобы уже была реализация обучения на pytorch
источник

TN

Timofey Naumenko in NLP_RU - Natural Language Processing & Text Mining
Пока смотрю в сторону penn treebank
источник
2021 February 17

G

Group in NLP_RU - Natural Language Processing & Text Mining
Дата-инженер — ключевой игрок в любой команде, где есть аналитика. Этот специалист отвечает за сбор, хранение и удобную работу с данными. То есть помогает компании решать задачи быстрее и эффективнее. Спрос на таких айтишников очень высокий. Как и уровень их заработной платы.

Хотите стать крутым и незаменимым? Приходите на факультет Data Engineering от GeekBrains.

Чему научат:

— Автоматизировать технические процессы.
— Создавать конвейеры обработки данных.
— Разрабатывать архитектуру хранения данных.
— Настраивать мониторинги.
— Готовить данные для аналитиков.

Будет много практики от опытных дата-инженеров. Отработаете реальные задачи, соберете готовое портфолио, а эйчары из GeekBrains помогут вам найти работу!

Регистрируйтесь по ссылке
источник

АК

Андрей Копылов... in NLP_RU - Natural Language Processing & Text Mining
Всем привет) кто-нибудь может навскидку сориентировать по соотношению: объем чистых данных / железо = время обучения моделей doc2vec/word2vec.. Может кто-то обучал, есть примеры?

То же самое интересует по алгоритмам тематического моделирования.. И может посоветуете, какие алгоритмы наименее ресурсозатратны и наиболее быстродействующие?)

Понятно, что всё относительно и так сравнивать некорректно.. Интересует просто порядок цифр на примерах
источник

OM

Orzhan Mikhail in NLP_RU - Natural Language Processing & Text Mining
Андрей Копылов
Всем привет) кто-нибудь может навскидку сориентировать по соотношению: объем чистых данных / железо = время обучения моделей doc2vec/word2vec.. Может кто-то обучал, есть примеры?

То же самое интересует по алгоритмам тематического моделирования.. И может посоветуете, какие алгоритмы наименее ресурсозатратны и наиболее быстродействующие?)

Понятно, что всё относительно и так сравнивать некорректно.. Интересует просто порядок цифр на примерах
~несколько миллионов твитов, doc2vec, 12 часов
источник

АК

Андрей Копылов... in NLP_RU - Natural Language Processing & Text Mining
Orzhan Mikhail
~несколько миллионов твитов, doc2vec, 12 часов
А сколько примерно весили твиты в виде текстовых файлов и какое было железо?
источник
2021 February 18

OM

Orzhan Mikhail in NLP_RU - Natural Language Processing & Text Mining
Андрей Копылов
А сколько примерно весили твиты в виде текстовых файлов и какое было железо?
Насколько помню, 1.5 Гб текста и 4-ядерная виртуалка в google cloud.
источник

АК

Андрей Копылов... in NLP_RU - Natural Language Processing & Text Mining
Orzhan Mikhail
Насколько помню, 1.5 Гб текста и 4-ядерная виртуалка в google cloud.
Спасибо 👌
источник
2021 February 23

AG

Alexander Gansior in NLP_RU - Natural Language Processing & Text Mining
Андрей Копылов
Всем привет) кто-нибудь может навскидку сориентировать по соотношению: объем чистых данных / железо = время обучения моделей doc2vec/word2vec.. Может кто-то обучал, есть примеры?

То же самое интересует по алгоритмам тематического моделирования.. И может посоветуете, какие алгоритмы наименее ресурсозатратны и наиболее быстродействующие?)

Понятно, что всё относительно и так сравнивать некорректно.. Интересует просто порядок цифр на примерах
Если данные правильно подготовлены, word2vec на вектор 500 , считается 1.5 часа на ноутбуке 2 ядра, 2.7 гц, память 8 гб, теста 10гб.
источник
2021 February 24

G

Group in NLP_RU - Natural Language Processing & Text Mining
Приглашаем начинающих аналитиков данных на стажировку в Яндекс!

Что это?
От трёх до шести месяцев оплачиваемой работы в реальном проекте бок о бок с опытным ментором и командой крутых разработчиков. Вы сможете выйти на стажировку уже сейчас — неполная занятость и гибкий график позволяют совмещать работу с учёбой — или пройти интервью и получить оффер на лето.

Чем заниматься? Аналитики в Яндексе собирают, обрабатывают, изучают и анализируют данные, помогая бизнесу принимать правильные решения. Примеры реальных задач можно узнать из статьи.

Где: Москва, офис Яндекса. Если вы из другого города, мы оплатим дорогу и проживание в Москве.

От кандидатов ждём:
- уверенных знаний теории вероятностей и математической статистики,
- уверенных навыков написания кода на Python,
- знание базовых алгоритмов и структур данных.

Этапы отбора: тестовое задание, 2-3 технических интервью и знакомство с командами.  

Как откликнуться? Заполнить заявку можно на сайте
https://clck.ru/TNWUE
источник