Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 August 24

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
ну да :)
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
это внутренности скрипта по ссылке )
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
Но конечно, интересно, что по-другому вроде задачу сейчас не решили (по крайней мере быстрый гугл не находит (
источник

P

Pi in NLP_RU - Natural Language Processing & Text Mining
>from yargy.predicates import eq, caseless, normalized, type
>NUM_RAW = rule(morph_pipeline(NUMS_RAW).interpretation(Number.int.normalized().custom(NUMS_RAW.get)))
то есть насколько я могу понимать кейсы типа
'два' 'двух обрабатываются'
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
не смотрела, как там сделано, но я про это и говорила, что через pymorphy достать ядерные формы слова
источник

P

Pi in NLP_RU - Natural Language Processing & Text Mining
LITERALS = {
   'один': 1,
   'два': 2,
   'три': 3
}

LITERAL = dictionary(LITERALS).interpretation(
   interp.normalized().custom(LITERALS.get)
)


show_matches(
   LITERAL,
   'без двух',
   'один, два'
)
без двух
   ────
2
один, два
────  ───
[1, 2]
источник

P

Pi in NLP_RU - Natural Language Processing & Text Mining
взято отсюда
источник

P

Pi in NLP_RU - Natural Language Processing & Text Mining
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
Напишите потом, как работает библиотека, сохраню себе, чтобы не изобретать велосипеды)
источник

P

Pi in NLP_RU - Natural Language Processing & Text Mining
Tatiana Rogovich
Напишите потом, как работает библиотека, сохраню себе, чтобы не изобретать велосипеды)
обязательно
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
но выглядит legit)
источник

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Ребят, всем приветики!))

Задача - keyword extraction. Я правильно понимаю, что https://github.com/LIAAD/yake относится к простым статистическим подходам и можно на него не обращать внимание и сразу за ML браться?

Просто человек написал код на нём + фильтрация кейвордов через is_stop/is_punct из spaCy, плюс ещё прикрутил tf-idf. Но сейчас работает тупо, да и после нейронок есть ощущение, что проще с нуля сейчас своё уже написать, чем пинать это решение.
источник
2020 August 25

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
#meetup #митап #datascience

Уже в этот четверг в 19:00 (27 августа)🗓 состоится митап, на котором вы погрузитесь в загадочный мир интересов продвинутых экспертов, помимо Data Science:

👉 О чём с детства мечтал Евгений Виноградов, руководитель отдела разработки хранилищ данных (Яндекс.Деньги)?

👉 Чем занимается в свободное от работы время datascientist и алгоритмический трейдер Алекс Леков?

🔥Регистрация на Meetup здесь
источник
2020 August 27

rd

rus dacent in NLP_RU - Natural Language Processing & Text Mining
источник
2020 September 01

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
✅Уже завтра в 19:00 (02 сентября)🗓 пройдёт Meetup, на котором мы не только приоткроем завесу тайны Диалоговых ассистентов, но и расскажем как предсказать извержение вулкана🌋, а так же затронем темы футбола⚽️ и рекомендательных систем:

📍Про какие недавние прорывы и нерешённые задачи в Диалоговых ассистентах расскажет, Дале Давид Сергеевич, фрилансер и NLP engineer?

📍Как Полунина Полина - Ex руководитель Data Science направлений HR, Финансы, Видеоаналитика в группе ”М.Видео-Эльдорадо“, преподаватель НИУ ВШЭ, победитель международных чемпионатов по анализу данных,  предсказывает извержение вулкана на основе анализа сейсмических данных?

📍Что думает о дружбе датасайентистов и футболистов Мифтахов Сайдаш Мансурович -  Data Scientist "Северсталь"?

📍Какие Offline модели рекомендаций для классифайда использует Василий Лексин, Head of Analytics (Recommendations) в "AVITO.RU"?

Ответы на все эти вопросы вы получите уже совсем скоро👇

📌Регистрация на Meetup на канале по ссылке👍
источник
2020 September 02

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Ребят, всем привет!

А можно ли использовать SOTA-модели для вытаскивания ключевых слов? Типа классификация токенов, например (вероятность того, что токен является ключевым словом) - стоит вообще пробовать или нет?
источник

DD

David Dale in NLP_RU - Natural Language Processing & Text Mining
Lev Lunev
Ребят, всем привет!

А можно ли использовать SOTA-модели для вытаскивания ключевых слов? Типа классификация токенов, например (вероятность того, что токен является ключевым словом) - стоит вообще пробовать или нет?
Использовать можно что угодно, вопрос, какое качество ты получишь, и, главное, как ты это качество будешь мерять)
источник

DD

David Dale in NLP_RU - Natural Language Processing & Text Mining
Если есть обучающая выборка со словами в тексте, отмеченными как (не)ключевыми, можно берт на задачу тегирования слов пофайнтюнить, должно хорошо выйти.
источник

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Вот, как раз это и хочу) Датасет готов, нашёл репу https://github.com/ibatra/BERT-Keyword-Extractor, но там код старый.

Спасибо!)
источник