Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 December 20

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
ещё, кстати, кажется, что в болтовне чаще встречаются местоимения личные и указательные (а в запросах нет)

но в целом, короче, да, кажется, что осмысленней именно использовать какой-то классификатор, в котором можно дополнительно акцентировать внимание на конкретные фичи. и сначала действительно посмотреть на данные хорошенько и подумать, в чём типичные различия между классами
источник

БД

Борис Добров... in NLP_RU - Natural Language Processing & Text Mining
Зачем же все решать в лоб?
Какая разметка, если есть и тв программа и новости, и культура с историей, и продукты с товарами. И называться они могут с местоимениями и с  пунктуацией. Типа "моя семья", соки "я" и т.п.
То есть надо менять постановку задачи!
Либо история диалога, либо маркеры, либо надо "держать"  все вертикали = поисковики по разным коллекциям.
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
вообще есть некоторое подозрение, что люди чаще используют маркеры запроса (типа "Алиса, найди") именно в голосовых ассистентах, ср. строка браузера, где и так очевидно, что это именно эта узкая спецзадача
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
про историю диалога хорошее замечание
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
а называться что угодно может с пунктуацией, но её даже в обычных-то поисковиках в норме опускают
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
а про местоимения и прочее было замечание скорее про частотности, потому что в любом нормальном диалоге то же "ты" (и формы 2 л. глаголов) явно будут встречаться чаще, чем в корпусе рандомных запросов
источник
2020 December 21

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
💥 Для тех, кто развивается в ML-разработке и Data Science. Новичкам и с опытом в Python.

- Регистрация открыта до 24 декабря включительно.
- Грант 4000 рублей - для всех участников на использование Yandex DataSphere.
https://bit.ly/2KIwkbT

AI Community и Yandex.Cloud впервые запускают онлайн-соревнование по анализу данных Yet Another Data Challenge.

Этот конкурс для тебя, если тебе интересно:
🟡 проверить свои навыки и получить опыт решения интересной задачи по генеративному ML;
🟡 пообщаться с опытными экспертами из Yandex.Cloud в чате и на вебинарах соревнования;
🟡 создать свою первую генеративную мелодию;

🏆 Призы конкурса:
1 место: MacBook Air 13 дюймов, 512 Гб + грант на DataSphere 150 000 руб;
2 место: Apple iPhone 12 Pro 6,1 дюйма + грант на DataSphere 100 000 руб;
3 место: Apple Watch Series 6 размер + грант на DataSphere 50 000 руб;

Топ-10 участников - награждаются Yandex Станцией Мини;
200 активных участников получают футболки Yandex.Cloud.

Регистрация, детали и лидерборд: https://bit.ly/2KIwkbT
источник
2020 December 23

P

Polyanskiy in NLP_RU - Natural Language Processing & Text Mining
Всем привет, есть ли готовые решения для анализа или кодирования (эмбеддинги) лингвистического стиля автора?

Задачей стоит находить людей, которые оставляют посты на форуме, используя несколько аккаунтов. Идея в том, что стилистически такие посты могут быть близки друг другу
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
ну в классической стилометрии, как ни странно, один из лучших методов на данный момент основан чуть ли не на тупо частотностях конкретных слов. гуглить stylometry, есть пакет для R и наверняка для питона тоже
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
ну а так - тупо пройтись хотя бы по https://github.com/topics/stylometry и https://github.com/topics/author-identification
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
источник

P

Polyanskiy in NLP_RU - Natural Language Processing & Text Mining
Natalia
ну в классической стилометрии, как ни странно, один из лучших методов на данный момент основан чуть ли не на тупо частотностях конкретных слов. гуглить stylometry, есть пакет для R и наверняка для питона тоже
Спасибо большое
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
да не за что
вот тут есть обзор с очень странным сочетанием места публикации и русскими авторами, но выглядит при этом как будто бы очень адекватно: https://fruct.org/publications/fruct25/files/Lag.pdf

там видно, что эмбеддинги как будто бы особо действительно пока не очень интенсивно в этом используются, ну и есть куча ссылок на работы

в частности, на Рудера с компанией, которые как будто что-то делали, но кода я не нашла: https://arxiv.org/pdf/1609.06686.pdf
источник

P

Polyanskiy in NLP_RU - Natural Language Processing & Text Mining
Со своей стороны я пока нашел только применение ГАНов для выделения и переноса стилей
https://youtu.be/KK7VruLo9vg?t=1127

Первое интуитивное желание у меня было взять BERT и дообучить с акцентом на стиль. Но пока непонятно, как именно это лучше сделать
источник
2020 December 24

I

Ilya in NLP_RU - Natural Language Processing & Text Mining
небольшой вопрос на счет CFG используя nltk:

у меня задача такая (простая учебная), у меня сложность с определением значения у которого есть пробелы и состоит из нескольких слов.
источник

I

Ilya in NLP_RU - Natural Language Processing & Text Mining
далее конструирую деревья некоторых простых значений.
источник

I

Ilya in NLP_RU - Natural Language Processing & Text Mining
но получаю:
источник

I

Ilya in NLP_RU - Natural Language Processing & Text Mining
что ожидаемо исходя из деревьев
источник

I

Ilya in NLP_RU - Natural Language Processing & Text Mining
как это синтактически правильно пишется ?
источник
2020 December 28

PZ

Pavel Zheltouhov in NLP_RU - Natural Language Processing & Text Mining
приветствую.
подскажите, а есть какая-нибудь механика или прием, делающий из условного телеграм-чата, условный корпус и достаточно халявно?
какая-то работа с временным окном или наиболее вероятные сцепления разных reply в длинные документы?

дело в том, что все осмотренные мной техники NLP тяготеют к обработке сравнительно длинных текстов.
при попытке перенести их на сообщения, зачастую ничего осмысленного не получается. слишком короткие сообщения.

надеюсь, это задача типовая и много раз решалась в последнее время.
источник