Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2021 March 29

AW

Alex Wortega in NLP_RU - Natural Language Processing & Text Mining
Ну смотря что вы хотите
источник

AW

Alex Wortega in NLP_RU - Natural Language Processing & Text Mining
И каким образом
источник

VA

Vitaliy Ababiy in NLP_RU - Natural Language Processing & Text Mining
Alex Wortega
Схематизация текста это вообще как?
Ещё не знаем, но сами уже все Миро картинками засрали пока читали. Надоело, слышали про комбинированные нейронки речь-текст-графика, вот ищем где что есть.
источник

PZ

Pavel Zheltouhov in NLP_RU - Natural Language Processing & Text Mining
ничего не понятно...но человек вашу задачу может осознать и сделать?
источник

VA

Vitaliy Ababiy in NLP_RU - Natural Language Processing & Text Mining
Alex Wortega
Не проще процедрно генерировать?
Может быть, рисование по процедуре, а есть задел - процедурно рисовать это как?
источник

VA

Vitaliy Ababiy in NLP_RU - Natural Language Processing & Text Mining
Pavel Zheltouhov
ничего не понятно...но человек вашу задачу может осознать и сделать?
Ну да, читаем текст, сами схематизируем содержание. Есть некие соглашения про использование знаков.
источник

VA

Vitaliy Ababiy in NLP_RU - Natural Language Processing & Text Mining
Ну или типа рисование условия задачи по геометрии по описанию. Так сказать упрощенный вариант нашей задачи  и учебник геометрии как датасет :-)
источник

PZ

Pavel Zheltouhov in NLP_RU - Natural Language Processing & Text Mining
сложно как-то и непонятно.
за это платят?
неужели все чатботы уже написаны, а кредитные скоринги обобрали людей до нитки?
источник

AW

Alex Wortega in NLP_RU - Natural Language Processing & Text Mining
Vitaliy Ababiy
Ну или типа рисование условия задачи по геометрии по описанию. Так сказать упрощенный вариант нашей задачи  и учебник геометрии как датасет :-)
Почитайте про коллапс волновой функции и всякий генеративный контент.
источник

VA

Vitaliy Ababiy in NLP_RU - Natural Language Processing & Text Mining
Pavel Zheltouhov
сложно как-то и непонятно.
за это платят?
неужели все чатботы уже написаны, а кредитные скоринги обобрали людей до нитки?
Не все гранты ещё розданы :-)
источник
2021 March 30

D•

Dan • Captain in NLP_RU - Natural Language Processing & Text Mining
Оказывается, Google не выкладывал датасет C4 на котором тренировался T5, а выложили они лишь скрипт для его сборки. Всё бы хорошо, но на предобработку нужно несколько дней и несколько сотен CPU. AllenNLP выложили запрепроцешенную версию C4, теперь, чтобы скачать  все 800Gb достаточно выполнить

sudo apt install git-lfs
git clone https://huggingface.co/datasets/allenai/c4
cd c4
git lfs pull --include c4/en


также обещают скоро выложить его в формате 🤗 Datasets, чтобы можно было загрузить в одну строчку из питона
источник
2021 April 02

АК

Андрей Копылов... in NLP_RU - Natural Language Processing & Text Mining
Господа, кто может подсказать по предобработке текстов для использования предобученного трансформера universal sentence encoder 3. Задача docs similarity. Тексты длинные по 10 тыс слов каждый.

Вопросы:
1. Стоп слова актуально убирать?
2. Предлоги убирать?
3. Лемматизация?
4. Разбивать на предложения и векторизовать по отдельности, а потом усреднять вектора в пределах одного текста? Или разбивать текст на 128 слов (количество токенов на вход модели) и усреднять по 128?
5. Выделять из текста ключевые фразы с помощью модели keyBERT и их использовать вместо всего текста, векторизуя каждую фразу по отдельности, а потом усреднять для всего текста.
6. Определять предварительно тематику текста и осуществлять поиск только по текстам с такой же тематикой.

Что из этого актуально в общем случае?
источник
2021 April 03

וק

ולדימיר קון... in NLP_RU - Natural Language Processing & Text Mining
Андрей Копылов
Господа, кто может подсказать по предобработке текстов для использования предобученного трансформера universal sentence encoder 3. Задача docs similarity. Тексты длинные по 10 тыс слов каждый.

Вопросы:
1. Стоп слова актуально убирать?
2. Предлоги убирать?
3. Лемматизация?
4. Разбивать на предложения и векторизовать по отдельности, а потом усреднять вектора в пределах одного текста? Или разбивать текст на 128 слов (количество токенов на вход модели) и усреднять по 128?
5. Выделять из текста ключевые фразы с помощью модели keyBERT и их использовать вместо всего текста, векторизуя каждую фразу по отдельности, а потом усреднять для всего текста.
6. Определять предварительно тематику текста и осуществлять поиск только по текстам с такой же тематикой.

Что из этого актуально в общем случае?
первые три пункта не кажутся мне релевантными в контексте использования предобученного трасформера . 4. можно попробовать, но на длинных текстах особенно ожидать чуда от сентенс энкодера я бы не стал . (может лучше обычный берт? можно сделать какой-то пулинг, т.е. чанки по 768 , можно даже в overlap если есть длинные связи и потом это либо среднее, либо максимум и потом можно использовать уже это в сиамскую лстм. ) можно быстро это проверить, получить вектора от документов и посмотреть knn, umap. 5. можно попробовать, но у меня есть сомнения. 6 в этом больше смысла, по крайней мере это можно использовать как доп фичу. аутпут от LDA , или даже контекстуальные топики на базе берта. 7. если документы прям совсем длинные, но связи несильно интересны, можно попробовать суммаризировать. 8. в продолжении 7 , сделать VAE на берте и использовать репрезентацию документа в виде пониженной размерности. 9. когда будет нащупан метод long_doc2vec - faiss и кластеризация p.s. можно попробовать еще longformer , я его правда один раз пробовал и на моей небольшой задаче он не сильно помог, но была  возня с загрузкой не стандартной модели. не знаю как сейчас
источник

АК

Андрей Копылов... in NLP_RU - Natural Language Processing & Text Mining
ולדימיר קון
первые три пункта не кажутся мне релевантными в контексте использования предобученного трасформера . 4. можно попробовать, но на длинных текстах особенно ожидать чуда от сентенс энкодера я бы не стал . (может лучше обычный берт? можно сделать какой-то пулинг, т.е. чанки по 768 , можно даже в overlap если есть длинные связи и потом это либо среднее, либо максимум и потом можно использовать уже это в сиамскую лстм. ) можно быстро это проверить, получить вектора от документов и посмотреть knn, umap. 5. можно попробовать, но у меня есть сомнения. 6 в этом больше смысла, по крайней мере это можно использовать как доп фичу. аутпут от LDA , или даже контекстуальные топики на базе берта. 7. если документы прям совсем длинные, но связи несильно интересны, можно попробовать суммаризировать. 8. в продолжении 7 , сделать VAE на берте и использовать репрезентацию документа в виде пониженной размерности. 9. когда будет нащупан метод long_doc2vec - faiss и кластеризация p.s. можно попробовать еще longformer , я его правда один раз пробовал и на моей небольшой задаче он не сильно помог, но была  возня с загрузкой не стандартной модели. не знаю как сейчас
Спасибо 👍  насчёт LDA - он же работает очень медленно.. Вообще не уверен, что смогу через него кластеризовать даже 100 тыс документов по 10 тыс слов на одном ПК, хоть и довольно мощном..
8-9 пункт пока не совсем в теме, пойду гуглить)
источник

וק

ולדימיר קון... in NLP_RU - Natural Language Processing & Text Mining
Андрей Копылов
Спасибо 👍  насчёт LDA - он же работает очень медленно.. Вообще не уверен, что смогу через него кластеризовать даже 100 тыс документов по 10 тыс слов на одном ПК, хоть и довольно мощном..
8-9 пункт пока не совсем в теме, пойду гуглить)
ну берт работает тоже не быстро)
источник

АК

Андрей Копылов... in NLP_RU - Natural Language Processing & Text Mining
ולדימיר קון
ну берт работает тоже не быстро)
Ну векторизует предложения и ключевые слова извлекает довольно быстро на GPU.. А lda есть реализация с ускорением на gpu?)
источник

וק

ולדימיר קון... in NLP_RU - Natural Language Processing & Text Mining
Андрей Копылов
Ну векторизует предложения и ключевые слова извлекает довольно быстро на GPU.. А lda есть реализация с ускорением на gpu?)
я рекомендую запустить инференс берта на длинных документах. поскольку видимо у вас не было опыта.
источник

АК

Андрей Копылов... in NLP_RU - Natural Language Processing & Text Mining
ולדימיר קון
я рекомендую запустить инференс берта на длинных документах. поскольку видимо у вас не было опыта.
Там после 52 слов вектор не меняется в модели, которую я тестил
источник

וק

ולדימיר קון... in NLP_RU - Natural Language Processing & Text Mining
там O(n*n) от длины последовательности. без паддинг и обрезки по макс длине можно пару дней инференсить 20к даже на гпу
источник

АК

Андрей Копылов... in NLP_RU - Natural Language Processing & Text Mining
То есть по 52 слова надо делить
источник