Size: a a a

2020 December 15

SK

Stanislav Kirillov in catboost_ru
Вы пробовали регуляризацию еще крутить? Я правильно понимаю, что серые точки это трейнсет?
источник

YP

Yegor Plyashkov in catboost_ru
С катбустом не пробовал регуляризацию
источник

YP

Yegor Plyashkov in catboost_ru
Серые - это вся БД
источник

SK

Stanislav Kirillov in catboost_ru
а черное это истинная функция?
источник

OL

Oleg Litvinov in catboost_ru
Дмитрий Симаков
Возьми лгбм, поставь режим леса, и очень много алгоритмов. Вдруг повезет)
А есть вообще какая-то разница со склерновской имплементацией RF? Или это чисто, чтобы апи не менять?)
источник

ДС

Дмитрий Симаков... in catboost_ru
И в фичах что - время, лаги предыдущих значений или что.
источник

YP

Yegor Plyashkov in catboost_ru
Stanislav Kirillov
а черное это истинная функция?
Нет, это аналитическая модель)
Которая тоже пытается приблизить данные
источник

ДС

Дмитрий Симаков... in catboost_ru
Oleg Litvinov
А есть вообще какая-то разница со склерновской имплементацией RF? Или это чисто, чтобы апи не менять?)
Я не знаю деталей имплементации, но лес у лгбм существенно быстрее, но качество хуже склерн версии из моего опыта.
источник

YP

Yegor Plyashkov in catboost_ru
Дмитрий Симаков
И в фичах что - время, лаги предыдущих значений или что.
По X - одна из входных фичей, по Y - одна из выходных

Временной и пространственной структуры тут нет
источник

OL

Oleg Litvinov in catboost_ru
Дмитрий Симаков
Я не знаю деталей имплементации, но лес у лгбм существенно быстрее, но качество хуже склерн версии из моего опыта.
Интересно. Почитать надо на досуге. Можно было бы предположить, что они просто свои оптимизации и навороты к фичам добавили в обычный RF, но это только идеи
источник

ДС

Дмитрий Симаков... in catboost_ru
Скорее всего, тупо свои деревья с методами сэмплирования независимо строят и усредняют, да.
источник

A

Andrew in catboost_ru
Привет, поделитесь свои опытом, если мне в задаче ранжирования важно только верное определение топ-1, то какие целевые функции стоит пытаться перебирать? Из чтения доков показалось, что можно пробовать только QuerySoftMax и YetiRankPairwise, есть ли истории успеха с другими целевыми лоссами? Еще 1 специфика: для примеров в группе есть оценки "плохости" x из  [0;+inf), если я сделаю лейблы -x, то будут ли автоматом веса пар браться на основании x_1 - x_2 (ну или exp(x_1 - x_2) или exp(x_1) - exp(x_2), просто чтобы учитывало, насколько хуже станет итоговый скор). На всякий случай, в итоге, оптимизирую средний x по датасету.
источник
2020 December 16

DG

D G in catboost_ru
Привет! Я начинающих пользователь обучения на деревьях (больше использую нейросети). 1. Как обучать катбуст на объеме данных, который в сотни раз больше объема оперативной памяти? 2. Как дообучать модель на стриминговых (свежих) данных? Спасибо
источник

VB

Valeriy Babushkin in catboost_ru
и на первый и на второй вопрос решение одинаковое, так как катбуст это набор деревьев, которые обучаются на разных подвыборках, но прогнозируют ошибки предыдущего дерева, то можно последовательно учить каждое дерево на новой подвыборке данных
источник

VB

Valeriy Babushkin in catboost_ru
точно так же и с дообучением
источник

DG

D G in catboost_ru
Valeriy Babushkin
и на первый и на второй вопрос решение одинаковое, так как катбуст это набор деревьев, которые обучаются на разных подвыборках, но прогнозируют ошибки предыдущего дерева, то можно последовательно учить каждое дерево на новой подвыборке данных
я вас вчера видел в ютубе 😉
источник

VB

Valeriy Babushkin in catboost_ru
удачное совпадение
источник

DG

D G in catboost_ru
D G
я вас вчера видел в ютубе 😉
Спасибо, Валерий! Категорийные данные надо специально готовить? У меня после перевода категорий в integers работает норм, без перевода - не работает. Так и должно быть?
источник

DG

D G in catboost_ru
Valeriy Babushkin
и на первый и на второй вопрос решение одинаковое, так как катбуст это набор деревьев, которые обучаются на разных подвыборках, но прогнозируют ошибки предыдущего дерева, то можно последовательно учить каждое дерево на новой подвыборке данных
интересно, в какой контексте люди обсуждают кластеры тогда, если эта штука итеративно нормально обучается? Зачем спарк и прочее?
источник

VB

Valeriy Babushkin in catboost_ru
одно не отменяет другого, можно строить дерево используя сразу несколько машин
источник