Size: a a a

2021 January 02

d

dePuff in catboost_ru
Вопрос требований к качеству, количеству данных и ресурсов

На последнем майлрушном соревновании по токсичным комментариям tf-idf + логрег на 1% хуже берта был
источник

d

dePuff in catboost_ru
Кашницкий тоже недавно презентацию делал, что на неком объёме учебных примеров логрег догонит Берта на классификации

Если понимать как оно внутри работает, то очевидно почему
источник

ДС

Дмитрий Симаков... in catboost_ru
На яндекс контесте 19 года была задача определения тэгов (тем) новостей. Победил мешок слов. В топ три оказались и эмбеддинги, и берт.
источник

OR

Oleg Ruban in catboost_ru
Плюсую, часто для прода Берт проигрывает более простым моделям по классификации тональности и темы т.к. там не так много зависимостей контекста требуется, а модели по итогу весят в десятки, а то и сотни раз меньше.
источник

PT

Pavel Tomsha in catboost_ru
Делаю predict_proba для CatBoostClassifier. Выполняется стабильно в одном потоке. Установка значения thread_count например в 3 ничего не меняет - на компуктере во время прогнозирования загружено только одно ядро (на 100%), остальные простаивают.
Что можно сделать, чтобы predict_proba загружали побольше ядер?
Ubuntu 18.04.5, python, pip package catboost 0.24.4
источник

ДД

Дима Драгфри... in catboost_ru
Pavel Tomsha
Делаю predict_proba для CatBoostClassifier. Выполняется стабильно в одном потоке. Установка значения thread_count например в 3 ничего не меняет - на компуктере во время прогнозирования загружено только одно ядро (на 100%), остальные простаивают.
Что можно сделать, чтобы predict_proba загружали побольше ядер?
Ubuntu 18.04.5, python, pip package catboost 0.24.4
Попробуй в thread_count указать "-1", я могу ошибаться, но вроде при данном значении задействуются все доступные ядра.
источник

PT

Pavel Tomsha in catboost_ru
Дима Драгфри
Попробуй в thread_count указать "-1", я могу ошибаться, но вроде при данном значении задействуются все доступные ядра.
-1 - это значение по умолчанию. Если задать его явно, то точно также эффекта нет
источник

SK

Stanislav Kirillov in catboost_ru
А в датасете нет кучи стринг переменных типа текстов или катфичей?
источник

PT

Pavel Tomsha in catboost_ru
Stanislav Kirillov
А в датасете нет кучи стринг переменных типа текстов или катфичей?
Куча катфичей есть. Но кажется, что для predict это особо не должно быть проблемой. По дереву, скорее всего, прогноз в одном потоке делается независимо от типа фичей. Но как минимум всегда можно разбить набор данных на батчи и запускать прогноз на каждом из них в разных потоках. Выглядит как будто так оно и должно работать, потому и спрашиваю
источник
2021 January 03

DG

D G in catboost_ru
провет, если ли какой-то способ использовать ГПУ с init_model?
источник
2021 January 04

L

LS in catboost_ru
Вопрос к команде, сейчася в процессе тестирования, и работаю с небольшой базой, табличные данные. Train df 7.3 gb, Val df 4.8gb. И меня волнует нагрузка на память, сейчас она около 20 гигов, не много ли?
источник

L

LS in catboost_ru
И какое будет потребление памяти при условии что train df будет 700-800 гб и соответственно Val df 200gb? То есть памяти потребуется в 100 раз больше?
источник

TB

Taras B in catboost_ru
LS
Вопрос к команде, сейчася в процессе тестирования, и работаю с небольшой базой, табличные данные. Train df 7.3 gb, Val df 4.8gb. И меня волнует нагрузка на память, сейчас она около 20 гигов, не много ли?
Сильно зависит от фичей. Можно с типами поиграть. И сильно срезает память выставление параметра max_ctr_complexity=1
источник

L

LS in catboost_ru
Taras B
Сильно зависит от фичей. Можно с типами поиграть. И сильно срезает память выставление параметра max_ctr_complexity=1
Тогда может упасть accuracy так как взаимосвязей между категориальными фичами будет меньше. Наверно вопрос сводится к банальному, хватит ли 128 гб памяти или нет?
источник

L

LS in catboost_ru
А если по фичам то их около 1700 14 из которых категориальные
источник

TB

Taras B in catboost_ru
LS
Тогда может упасть accuracy так как взаимосвязей между категориальными фичами будет меньше. Наверно вопрос сводится к банальному, хватит ли 128 гб памяти или нет?
Ну это понятно, только цена вопроса обычно стоит этой просадки в проме
источник

L

LS in catboost_ru
Taras B
Ну это понятно, только цена вопроса обычно стоит этой просадки в проме
В смысле в проме? Не очень понимаю 🙂
источник

TB

Taras B in catboost_ru
LS
В смысле в проме? Не очень понимаю 🙂
В продакшене. Если вопрос не для соревнований)
источник

L

LS in catboost_ru
Taras B
В продакшене. Если вопрос не для соревнований)
Для себя)
источник

TB

Taras B in catboost_ru
Ну тогда проверь снижается или нет метрика. Часто, реально не заметно)
источник