Size: a a a

2020 December 16

VB

Valeriy Babushkin in catboost_ru
на каждой фиче идет перебор значений, соотвественно эти переборы можно делать в паралель
источник

VB

Valeriy Babushkin in catboost_ru
D G
Спасибо, Валерий! Категорийные данные надо специально готовить? У меня после перевода категорий в integers работает норм, без перевода - не работает. Так и должно быть?
надо читать документацию катбуста
источник

DG

D G in catboost_ru
Valeriy Babushkin
надо читать документацию катбуста
👍
источник

TB

Taras B in catboost_ru
D G
интересно, в какой контексте люди обсуждают кластеры тогда, если эта штука итеративно нормально обучается? Зачем спарк и прочее?
Итеративно не всегда получается. Не все новые фичи поддерживают дообучение.
источник

DG

D G in catboost_ru
Taras B
Итеративно не всегда получается. Не все новые фичи поддерживают дообучение.
Не все новые фичи поддерживают дообучение. - можно чуть подробнее?
источник

TB

Taras B in catboost_ru
D G
Не все новые фичи поддерживают дообучение. - можно чуть подробнее?
Эмбединги и текстовые, например.
источник

DG

D G in catboost_ru
катбуст разве умеет кодировать категории в эмбеддинги?
источник

DG

D G in catboost_ru
или это претренерованные эмбеддинги из нейросетей можно запихнуть?
источник

DG

D G in catboost_ru
D G
или это претренерованные эмбеддинги из нейросетей можно запихнуть?
нашел туториал на эту тему https://www.youtube.com/watch?v=lB0WYoz5nU4
источник

A

Alexandr in catboost_ru
Добрый вечер! У меня вопрос
источник

A

Alexandr in catboost_ru
Сколько по времени будет выполнять catboost на пяти фолдах, если в задаче 40 тыс признаков
источник

A

Alexandr in catboost_ru
И 2 тыс строк
источник

A

Andrew in catboost_ru
Andrew
Привет, поделитесь свои опытом, если мне в задаче ранжирования важно только верное определение топ-1, то какие целевые функции стоит пытаться перебирать? Из чтения доков показалось, что можно пробовать только QuerySoftMax и YetiRankPairwise, есть ли истории успеха с другими целевыми лоссами? Еще 1 специфика: для примеров в группе есть оценки "плохости" x из  [0;+inf), если я сделаю лейблы -x, то будут ли автоматом веса пар браться на основании x_1 - x_2 (ну или exp(x_1 - x_2) или exp(x_1) - exp(x_2), просто чтобы учитывало, насколько хуже станет итоговый скор). На всякий случай, в итоге, оптимизирую средний x по датасету.
bump
источник
2020 December 17

ie

ismailka ermolov in catboost_ru
Всем привет!
Можете подсказать, как ускортть создание пула из датафрейма с большим кол-вом кат фичей?
При размере выборки около 1кк и кол-ве кат фичей около 600 создание пула занимает какое то дикое время (более 10 минут).
Что с этим можно сделать, как ускорить?

С числовыми фичами при размере выборки в 1кк * 5к проблем не было.
источник

ie

ismailka ermolov in catboost_ru
Столкнулся с проблемой, о которой говорит автор данного закрытого issue: https://github.com/catboost/catboost/issues/815

Есть воспроизводящий пример. Как следует поступить? Создать новое?
источник

s

sasha in catboost_ru
Andrew
Привет, поделитесь свои опытом, если мне в задаче ранжирования важно только верное определение топ-1, то какие целевые функции стоит пытаться перебирать? Из чтения доков показалось, что можно пробовать только QuerySoftMax и YetiRankPairwise, есть ли истории успеха с другими целевыми лоссами? Еще 1 специфика: для примеров в группе есть оценки "плохости" x из  [0;+inf), если я сделаю лейблы -x, то будут ли автоматом веса пар браться на основании x_1 - x_2 (ну или exp(x_1 - x_2) или exp(x_1) - exp(x_2), просто чтобы учитывало, насколько хуже станет итоговый скор). На всякий случай, в итоге, оптимизирую средний x по датасету.
кажется что задача ранжирования где важен только топ 1 это задача бинарной классификации.
источник

A

Andrew in catboost_ru
sasha
кажется что задача ранжирования где важен только топ 1 это задача бинарной классификации.
Ну catboost с 'QuerySoftMax' ее так и решает 😊
источник

SL

Sergey Lomdjaria in catboost_ru
Всем привет! Есть распространенное мнение, что применение Стандартизации над фичами никак не влияет на результаты работы бустинга. Но столкнулся, что в моей задаче применение StandardScaler над выборкой очень сильно изменило результаты.
Как это можно объяснить?
источник
2020 December 18

OL

Oleg Litvinov in catboost_ru
Коллеги, всем добрый день!

Поделитесь, пожалуйста, опытом использования бейзлайна. У меня в данных сильные шифты между трейном/валидацией/тестом и сам по себе регрессор, даже хорошо выучив периодичности, полностью фэйлит со сдвигом самих значений. Я пытался расширить обучающую выборку и в целом она покрывает все значения из валидации и теста. Но, видимо, так как большая часть данных всё же смещается, этого недостаточно. Попробовал попредиктить от нуля, а не от среднего по всей выборе (boost_from_average=False) — модель вообще не сходится. И вот играюсь с бейзлайном. Странное дело, но даже ликовые средние значения, посчитанные на полных трейновых и валидационных данных не помогают (и дефолтная модель, и модель с низким LR разлетаются), если их прокинуть в baseline. Если посмотреть на график, то для каждого объекта по сути в качестве бейзлайна используется его среднее значение. Казалось бы, за бустингом осталось только дневные и сезональные флукцуации посчитать, с чем он справлялся раньше. Сталкивался кто-нибудь с подобным? Может, не доконца понимаю смысл baseline и стоит просто стакнуть две модели: линейную для экстраполяции и бустинг для формы кривой?
источник

SK

Stanislav Kirillov in catboost_ru
А у тебя смещения в таргете или в фичах?
источник