Size: a a a

2020 December 18

SK

Stanislav Kirillov in catboost_ru
или и там и там
источник

OL

Oleg Litvinov in catboost_ru
В таргете в основном. Фичей достаточно много и они в принципе достаточно сильно разнообразны. Не думаю, что в них дело. В таргете прямо сильная разница
источник

OL

Oleg Litvinov in catboost_ru
источник

OL

Oleg Litvinov in catboost_ru
соответственно, если учить без бейзлайнов и трансформаций таргета, то этот дифферент между средним по трейну и средним по валидации остаётся(
и это не оч хорошо. но тут как бы взять нечего -  у нас деревья.
источник

OL

Oleg Litvinov in catboost_ru
пробовал из фичей поискать какие-нибудь, с помощью которых можно поделать difference и multiplication трансформации таргета. они в целом норм, но нет таких значений, которые хорошо приблизили бы все объекты в выборках (там разные продукты, скажем так). Поэтому думал на самих таргетах попробовать посчитать а ля статистики (как в вашем примере с бейзлайном, где либо считаются средние, либо строится простенькая линейная модель на части трейна)
источник

ДС

Дмитрий Симаков... in catboost_ru
Как таргет и фичи по времени меняются?
источник

OL

Oleg Litvinov in catboost_ru
Все таргеты имеют формулу перевёрнутой параболы вокруг среднего значения конкретного продукта (начало продаж - рост,  пик посередине, снижение к концу продаж). Их формы достаточно похожи. Отличаются только средние значения.

Фичи вариативны, т.к. продажи в разных местах в разные дни. Но в целом, я бы сказал, ничего необычного в фичах. Без лишних скачков и трендов
источник

OL

Oleg Litvinov in catboost_ru
я на графике стёр, (хотя это не особо сенситив) но по горизонтали продажи. соответственно продажи разные т.к. слегка разные продукты запускаются
источник

SK

Stanislav Kirillov in catboost_ru
По статусу 0.24.4 - добавили поддержку python 3.9, нашли еще сколько-то мешающих релизу багов в эмбеддингах, полирую их.
источник

OL

Oleg Litvinov in catboost_ru
Круто!)
источник

TP

Tymur Prorochenko in catboost_ru
Подскажите пожалуйста, хочу уменьшить размер модели (1 категориальный признак, 15к уникальных значений), но при увеличении  model_size_reg заметно проседает качество. И учитывая что в доках написано - The mapping from the categorical feature value hash to some statistic values is stored for each categorical feature that is used in the model.  Возникает вопрос - может самому часть этих стат значений посчитать и добавить как числовые фичи? Или это велосипед и мне все таки придется идти на компромис размер-качество?
источник

ИБ

Иван Брагин... in catboost_ru
EDIT: Через сколько примерно можно ожидать поддержку spark, 1-2 года?
источник

L

LS in catboost_ru
Tymur Prorochenko
Подскажите пожалуйста, хочу уменьшить размер модели (1 категориальный признак, 15к уникальных значений), но при увеличении  model_size_reg заметно проседает качество. И учитывая что в доках написано - The mapping from the categorical feature value hash to some statistic values is stored for each categorical feature that is used in the model.  Возникает вопрос - может самому часть этих стат значений посчитать и добавить как числовые фичи? Или это велосипед и мне все таки придется идти на компромис размер-качество?
Если есть время то экспериментировать с фичами, а если нет то конечно компромис
источник

SK

Stanislav Kirillov in catboost_ru
Иван Брагин
EDIT: Через сколько примерно можно ожидать поддержку spark, 1-2 года?
Середина-конец янавря
источник

ИБ

Иван Брагин... in catboost_ru
Ничего себе
источник

SK

Stanislav Kirillov in catboost_ru
Сейчас уже есть пререлиз, но с багами
источник

ИБ

Иван Брагин... in catboost_ru
Я не уверен что это корректный вопрос, но только Python или scala тоже? или там одно без другого не будет
источник

SK

Stanislav Kirillov in catboost_ru
И то и другое
источник

SK

Stanislav Kirillov in catboost_ru
Pyspark и скала
источник

SK

Stanislav Kirillov in catboost_ru
И катфичи поддержали
источник