Size: a a a

NLP_RU - Natural Language Processing & Text Mining

2020 July 23

E

Elena in NLP_RU - Natural Language Processing & Text Mining
если нет отчества, то значит человек иностранец и там вообще нереально по имени догадаться
источник

TR

Tatiana Rogovich in NLP_RU - Natural Language Processing & Text Mining
Maria
мне кажется, что если совсем простое решение, то отчество + какой-нибудь словарь имён (не все случаи покроет, но пишется быстро и работает сносно)

есть ли гендерные маркеры в какой-нибудь Наташе, не знаю (
Йеп
источник

D

D in NLP_RU - Natural Language Processing & Text Mining
Шайя Лабаф например. Словарь имен, окончание отчества, окончание фамилии.
источник

D

D in NLP_RU - Natural Language Processing & Text Mining
У дадаты есть апи https://dadata.ru/api/clean/name/
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
Константин
какие простые готовые решения есть для определения пола по ФИО?
мне почему-то кажется, что где-то даже дорожка на что-то похожее была
источник

К

Константин in NLP_RU - Natural Language Processing & Text Mining
спасибо. Посмотрим
пока просто сделали ручными правилами по окончанию, 98% случаев покрывает. Остальные просто пропускаем
источник

К

Константин in NLP_RU - Natural Language Processing & Text Mining
у нас данные строгие [фамилия имя отчество], без пропусков
источник
2020 July 24

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Ребят, всем привет!

Есть отчёты о том, кого добавили/убрали с должности в компании. И они могут быть в форматах типа...

[Убран/добавлен]: [должность]: [описание человека]
[Убран/добавлен] [должность]: [описание человека]
[Должность]: [описание человека]

При этом вокруг может быть ещё куча мусора. Я думал это решать через поиск человека с помощью NER и dependency-парсингом в spacy, но думаю, насколько это адекватно и подходит ли вообще исходная модель spacy для этого.
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Надо знать, с какой точностью работает модель NER для русского языка
источник

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Вообще, это для немецкого. Там под 85%
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Для испанского например NER в спейси работает очень плохо, так что это невозможно использовать в реальных задачах
источник

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
источник

E

Elena in NLP_RU - Natural Language Processing & Text Mining
Надо пробовать на вашем документе и смотреть, подходит вам такое качество или нет
источник

D

D in NLP_RU - Natural Language Processing & Text Mining
Lev Lunev
Ребят, всем привет!

Есть отчёты о том, кого добавили/убрали с должности в компании. И они могут быть в форматах типа...

[Убран/добавлен]: [должность]: [описание человека]
[Убран/добавлен] [должность]: [описание человека]
[Должность]: [описание человека]

При этом вокруг может быть ещё куча мусора. Я думал это решать через поиск человека с помощью NER и dependency-парсингом в spacy, но думаю, насколько это адекватно и подходит ли вообще исходная модель spacy для этого.
Список должностей небольшой, проще составить словарь и обработать glr парсером
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
под любой относительно большой язык есть смысл ещё искать NER-модели конкретно под него, а не из больших общих либ. ну или посмотреть побольше общих ещё, если там использовали спец. датасеты

вот Stanza, там что-то с GermEval, например: https://stanfordnlp.github.io/stanza/available_models.html#available-ner-models

ещё просто репа: https://github.com/riedlma/sequence_tagging
источник

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Всем большое спасибо, буду разбираться!

Всем приятных выходных)
источник
2020 July 27

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Ребят, всем снова привет!

А я правильно понимаю, что тренировка NER по сути учит модель понимать сущность из контекста?

То есть, если до этого мы не показывали ей какое-то имя, но тренировали её на других именах, то она сможет его найти?
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
или модель сама выводит правила (типа кавычек и заглавных букв, а также типичных суффиксов)
источник

LL

Lev Lunev in NLP_RU - Natural Language Processing & Text Mining
Спасибо!)
источник

N

Natalia in NLP_RU - Natural Language Processing & Text Mining
ну то есть одно не исключает другое
источник