Size: a a a

2020 December 30

IL

Ivan Lyzhin in catboost_ru
Это в новой версии так стало происходить?
источник

AF

Aleksey Firstov in catboost_ru
Я давно не пользовался катбустом, поэтому не могу точно сказать(
источник

TB

Taras B in catboost_ru
Ivan Lyzhin
Создай, пожалуйста, issue на github с примером. И для тормозов, и для dataframe.
Issue уже не нужны, как я понимаю. По ошибкам я разобрался, в эмбединг-фичах не умеет катбуст обрабатывать nan-ы. По тормозам - это работа knn
источник

IL

Ivan Lyzhin in catboost_ru
Taras B
Issue уже не нужны, как я понимаю. По ошибкам я разобрался, в эмбединг-фичах не умеет катбуст обрабатывать nan-ы. По тормозам - это работа knn
Да, можно не создавать
источник

AF

Aleksey Firstov in catboost_ru
Ivan Lyzhin
Это в новой версии так стало происходить?
фичи есть и числовые и категориальные, на первые не ругается
источник

IL

Ivan Lyzhin in catboost_ru
Создай, пожалуйста, на github issue с примером. У меня сходу это не воспроизводится.
источник

IL

Ivan Lyzhin in catboost_ru
Сергей
Здравствуйте. Извините за возможно глупый вопрос; я новичок в машинном обучении. Можно ли использовать CatBoost (и если да, то таким образом) для прогнозирования многомерных временных рядов?

То есть речь идет о прогнозировании вектора (кортежа) x[N] по известным векторам (кортежам) x[0], x[1], ..., x[N-1].

Здесь x[n] = (x[n,0], x[n,1], ..., x[n,K-1]), K - размерность кортежа x[n], n=0,1,2,...

Элементы x[n,k] кортежей могут быть как числовыми, так и категориальными.

И позвольте еще один вопрос: правильно ли я понимаю, что это так называемые панельные данные?
Напрямую CatBoost точно не получится применить к временным рядам. Для этого лучше подойдут другие инструменты. Можно, конечно, преобразовать это в задачу многомерной регресии, насчитав признаки по предыдущим наблюдениям самостоятельно. Тогда можно и катбуст заиспользовать - катбуст поддерживает многомерную регрессию. Может быть в чате кто-то делал такое и сможет поделиться опытом. Но со специализированными инструментами должно быть проще.
Про панельные данные - насколько я понял из вашей постановки задачи, ваши данные таковы не являются. В вашем случае это просто временной ряд.
источник

K

K-S in catboost_ru
Ivan Lyzhin
Напрямую CatBoost точно не получится применить к временным рядам. Для этого лучше подойдут другие инструменты. Можно, конечно, преобразовать это в задачу многомерной регресии, насчитав признаки по предыдущим наблюдениям самостоятельно. Тогда можно и катбуст заиспользовать - катбуст поддерживает многомерную регрессию. Может быть в чате кто-то делал такое и сможет поделиться опытом. Но со специализированными инструментами должно быть проще.
Про панельные данные - насколько я понял из вашей постановки задачи, ваши данные таковы не являются. В вашем случае это просто временной ряд.
Бустинги довольно часто весьма неплохо отрабатывают на всяких вручную сгенерированных лаговых фичах. А если их ещё объединить с какой-нибудь линейной моделью для экстраполяции, то вообще 👍🏻
источник

TP

Tymur Prorochenko in catboost_ru
всем ку,

делаю forward feature selection на gpu,
выглядит это приблизительно так:
pool_train = (x_train, y_train)
pool_train.quantize(task_type = 'GPU')

pool_val = (x_val, y_val)
pool_val.quantize(task_type = 'GPU')

some_loop:
   model = CatBoostClassifier(ignored_features = some_list, task_type = 'GPU')
   model.fit(pool_train, eval_set = pool_val)
   some_dict = model.get_best_score()

вопрос - много времени занимает инициализация по сравнению с временем расчета модели, можно ли как то по другому вертеть такую задачу?
источник
2021 January 01

АЛ

Артур Лазаренко... in catboost_ru
Добрый день, скажите, хорошая ли идея использовать Catboost для классификации твитов на позитивные и негативные? Или для этого лучше подходят LSTM?
источник

AY

Alexey Yurasov in catboost_ru
Артур Лазаренко
Добрый день, скажите, хорошая ли идея использовать Catboost для классификации твитов на позитивные и негативные? Или для этого лучше подходят LSTM?
Есть же deep pavlov sentiment
источник

TB

Taras B in catboost_ru
Артур Лазаренко
Добрый день, скажите, хорошая ли идея использовать Catboost для классификации твитов на позитивные и негативные? Или для этого лучше подходят LSTM?
BERT тогда уж
источник

АЛ

Артур Лазаренко... in catboost_ru
@format37 @sagol79 то есть CatBoost для такой задачи не подходит?
источник

TB

Taras B in catboost_ru
Артур Лазаренко
@format37 @sagol79 то есть CatBoost для такой задачи не подходит?
Шуруп молотком тоже можно забить )
источник

s

sasha in catboost_ru
Taras B
Шуруп молотком тоже можно забить )
а зачем в катбусте поддержка текстовых фичей тогда?
источник

TB

Taras B in catboost_ru
sasha
а зачем в катбусте поддержка текстовых фичей тогда?
А почему нет? Есть много задач, где текст как может дать дополнительную информацию модели. Но, мне кажется, брать catboost для задачи классификации текста - такое себе. Все, конечно, от цели зависит.
источник

s

sasha in catboost_ru
Taras B
А почему нет? Есть много задач, где текст как может дать дополнительную информацию модели. Но, мне кажется, брать catboost для задачи классификации текста - такое себе. Все, конечно, от цели зависит.
кажется что это эквивалентно решению сентимента катбустом, вопрос получается только в качестве классификации которое могут выжать алгоритмы из данных?
источник

TB

Taras B in catboost_ru
sasha
кажется что это эквивалентно решению сентимента катбустом, вопрос получается только в качестве классификации которое могут выжать алгоритмы из данных?
Да. Качество, думаю, будет сильно ниже. Но сам не сравнивал. Если кто-то пробовал, интересно послушать.
источник
2021 January 02

ДС

Дмитрий Симаков... in catboost_ru
Да ладно, не только от алгоритма зависит, но и от задачи, данных. Иногда и сгдрегрессор поверх мешка слов работает лучше берта.
источник

TB

Taras B in catboost_ru
Тут конкретно указана задача - сентимент твитов. Это задача для берта и подобного имхо.
источник