Я вообще не понимаю, что может сделать катбуст с массивом токенов Но может я не проснулся
Ну, у меня был текст, я его токенизировал. Получил массив чисел (массив токенов, как я это назвал). Теперь мне это надо загрузить в модель, как обучающие данные.
Ну, у меня был текст, я его токенизировал. Получил массив чисел (массив токенов, как я это назвал). Теперь мне это надо загрузить в модель, как обучающие данные.
Вчера записал ролик по CatBoost, возможно, будет интересно https://www.youtube.com/watch?v=OpQpYi_LtTQ. Запланировано 5 роликов, про настройку гиперпараметров и решение задач
А я правильно понимаю, что нет такой метрики как "лучший f1"? То есть такой f1 который на вход принимает proba , а на выходе дает f1 соответствующий лучшему трешхолду? Как я понимаю, обычный F1 бинаризует по порогу 0.5
С тз математики предлагаемая вами метрика смещена. Правильный математически подход - подбираем сами руками лучший порог на трейне (или отдельном куске трейна на котором не обучаемся - так ещё лучше) и считаем ф1 с одним единственным порогом который подобрали.
С тз математики предлагаемая вами метрика смещена. Правильный математически подход - подбираем сами руками лучший порог на трейне (или отдельном куске трейна на котором не обучаемся - так ещё лучше) и считаем ф1 с одним единственным порогом который подобрали.
Полностью осознаю, но тем не менее есть много юзкейсов где даже такая смещенная метрика лучше чем дефолтный F1