Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 November 02

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Дорогие коллеги! Уже завтра, 3 ноября в 10:00 (мск), состоится вебинар с участием СТО группы компаний InfoWatch Андрея Бирюкова. Будут затронуты темы управления софтверной разработкой в VUCA-мире, быстрые релизы сложных высоконагруженных b2b продуктов, наиболее востребованные и актуальные технологии среди клиентов компании, на каких задачах у можно прокачаться в использовании методов машинного обучения и, наконец, как оставаться лидером, когда твои решения - самые крутые на рынке, и приходится самому задавать себе планку и искать точки роста, чтобы не останавливаться в развитии.

InfoWatch работает на рынке информационной безопасности более 15 лет и лидирует в сегменте DLP-решений, систем для контроля каналов обмена информацией и защиты конфиденциальных данных. За эти годы предметная область сильно эволюционировала, в том числе, усилиями InfoWatch: технологи контентного анализа, обработки данных, применение ML методов, развитие визуальной аналитики другие модные подходы радикально изменили то, как устроены и работают современные DLP-системы.

3 ноября в 10:00 СТО InfoWatch Андрей Бирюков расскажет, куда развивается разработка в InfoWatch и о том, какие 30 вакансий открыты в R&D в компании.

Мероприятие бесплатное, регистрация по ссылке.
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
источник
2020 November 03

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Всем привет, ребятушки!

У кого-нибудь есть пример дистиляции берта? Гуглю второй день (видимо, плохо) - не могу найти пример нормального кода
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
@infernally_kind давай ещё раз, у нас бот злой что-то :)
источник

V

Vera in NLP_RU - Natural Language Processing & Text Mining
https://medium.com/huggingface/distilbert-8cf3380435b5 - пойдёт или что-то более специфичное?
источник

V

Vera in NLP_RU - Natural Language Processing & Text Mining
Dan • Captain
@infernally_kind давай ещё раз, у нас бот злой что-то :)
Это, кстати, тоже интересная NLP-задача - как понять, что пост со ссылочкой не спам))
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Vera
Это, кстати, тоже интересная NLP-задача - как понять, что пост со ссылочкой не спам))
kNN справляется через раз, модель переобучать пора
источник

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Спамеры тоже не спят, и подкидывают шумы, модель самообучается и появляются новые погрешности :)
источник

V

Vera in NLP_RU - Natural Language Processing & Text Mining
Интересно, какие модели сейчас SOTA по spam classification - тоже трансформеры или что-то ещё)
источник

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Спасибо! Затупил чё-то, забыл про них)))
источник

НД

Новиков Дмитрий... in NLP_RU - Natural Language Processing & Text Mining
Всем привет,
Есть какой то датасет с поисковым спамом? Вебстраницы сайтов? Желательно что-то более менее свежее.? Если не датасет, то интересные статьи для обнаружения текстового веб спама?
источник
2020 November 04

I

Ilya in NLP_RU - Natural Language Processing & Text Mining
Простой вопрос, заключается в общем в понимание английского (ну может и что имели ввиду) 😅

Define a function normalize_token that normalizes tokens by making them lowercase if at most the first character is uppercase.

Что из этого предложения понятно?
Нормализировать нужно только слова которые начинаются с больших букв?
at most  the first character - я тут at most не очень понимаю.
источник

MG

Mikhail Gorshkov in NLP_RU - Natural Language Processing & Text Mining
Ilya
Простой вопрос, заключается в общем в понимание английского (ну может и что имели ввиду) 😅

Define a function normalize_token that normalizes tokens by making them lowercase if at most the first character is uppercase.

Что из этого предложения понятно?
Нормализировать нужно только слова которые начинаются с больших букв?
at most  the first character - я тут at most не очень понимаю.
Максимально первая, а не 2-я и последующие буквы в апперкейсе
источник

I

Ilya in NLP_RU - Natural Language Processing & Text Mining
Вообще то да, в контексте того, что там работа идет только с текстами книги, в целом логично, что одинаковыми словами являются только те, которые отличаются большими буквами только правилом написания. То есть  First и  first, но не CompanyName  и CoMpAnYnAmE.
С точки зрения токенизации и нормализации, т.с.
источник
2020 November 08

Б

Баирто in NLP_RU - Natural Language Processing & Text Mining
Приветствую всех! Может кто подсказать? В deeppavlov хотел сделать ранжирование ответов что то не правильно делаю.
Вот код Python:

from deeppavlov import configs, train_model, build_model

rank_model = train_model(configs.ranking.ranking_default)
rank_model = build_model(configs.ranking.ranking_default)

print(rank_model(['Привет']))

Выводит пустую строку
источник

Б

Баирто in NLP_RU - Natural Language Processing & Text Mining
источник

Б

Баирто in NLP_RU - Natural Language Processing & Text Mining
источник

Б

Баирто in NLP_RU - Natural Language Processing & Text Mining
источник
2020 November 17

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Как научить компьютер понимать человека? А наладить бизнес-процессы с помощью машинного обучения? Что нужно для создания голосового помощника? А чатбота как сделать?

Такие задачи решают на Факультете обработки естественного языка (NLP-разработки) GeekBrains. Студенты с нуля изучают алгоритмы машинного обучения и основы программирования. Анализируют запросы, учат нейросеть работать с текстом, пишут свои программы. И после выпуска устраиваются на работу в топовые компании.


Что изучают на факультете

• Математические методы → анализ и моделирование.
• Работу с текстами → машинный перевод.
• Программирование на Python, библиотеки и фреймворки.
• Архитектуры MVP-решений.
• Создание чат-ботов.

О том, как получить востребованную профессию → по ссылке
источник
2020 November 22

ДП

Даниил Потапенков... in NLP_RU - Natural Language Processing & Text Mining
У меня такая задача. Пользователь пишет в чате вопрос или проблему и мне нужно вернуть ему статью из базы, которая дает статью которая отвечает на вопрос или проблему (или несколько наиболее подходящих статей). База это набор вопросов и ответов к ним (шагов решения проблемы). Что можно использовать? И есть ли похожие задачи которые уже решались?
источник