Хочу в целях образования сделать свой POS-теггер и читаю очень мудрые статьи, однако встал вопрос.
Я верно понимаю, что, основываясь на примере из этой статьи, я должен взять текст размеченный, разбить его на триграммы и переделать в датасет из указанных фич? Потом я запускаю какой-нибудь катбуст, делаю функцию разбиения на триграммы новых текстов, и модель мне волшебно предсказывает части речи для новых слов.
Но что в таком случае делать, если в корпусе никогда не было такого слова? Можно смотреть только по суффиксам-префиксам, но... мне не хватает пока знаний. Что можно ещё почитать?
в этом же вся идея машинного обучения - предсказывать класс новых текстов на основе "старых". Чем больше и разнообразнее тренировочные данные, тем лучше модель будет классифицировать новые слова, даже ни разу их "не видев". Ошибки будут всегда, например. 10% ошибок это очень хороший результат