Плюсую, часто для прода Берт проигрывает более простым моделям по классификации тональности и темы т.к. там не так много зависимостей контекста требуется, а модели по итогу весят в десятки, а то и сотни раз меньше.
Делаю predict_proba для CatBoostClassifier. Выполняется стабильно в одном потоке. Установка значения thread_count например в 3 ничего не меняет - на компуктере во время прогнозирования загружено только одно ядро (на 100%), остальные простаивают. Что можно сделать, чтобы predict_proba загружали побольше ядер? Ubuntu 18.04.5, python, pip package catboost 0.24.4
Делаю predict_proba для CatBoostClassifier. Выполняется стабильно в одном потоке. Установка значения thread_count например в 3 ничего не меняет - на компуктере во время прогнозирования загружено только одно ядро (на 100%), остальные простаивают. Что можно сделать, чтобы predict_proba загружали побольше ядер? Ubuntu 18.04.5, python, pip package catboost 0.24.4
Попробуй в thread_count указать "-1", я могу ошибаться, но вроде при данном значении задействуются все доступные ядра.
А в датасете нет кучи стринг переменных типа текстов или катфичей?
Куча катфичей есть. Но кажется, что для predict это особо не должно быть проблемой. По дереву, скорее всего, прогноз в одном потоке делается независимо от типа фичей. Но как минимум всегда можно разбить набор данных на батчи и запускать прогноз на каждом из них в разных потоках. Выглядит как будто так оно и должно работать, потому и спрашиваю
Вопрос к команде, сейчася в процессе тестирования, и работаю с небольшой базой, табличные данные. Train df 7.3 gb, Val df 4.8gb. И меня волнует нагрузка на память, сейчас она около 20 гигов, не много ли?
Вопрос к команде, сейчася в процессе тестирования, и работаю с небольшой базой, табличные данные. Train df 7.3 gb, Val df 4.8gb. И меня волнует нагрузка на память, сейчас она около 20 гигов, не много ли?
Сильно зависит от фичей. Можно с типами поиграть. И сильно срезает память выставление параметра max_ctr_complexity=1
Сильно зависит от фичей. Можно с типами поиграть. И сильно срезает память выставление параметра max_ctr_complexity=1
Тогда может упасть accuracy так как взаимосвязей между категориальными фичами будет меньше. Наверно вопрос сводится к банальному, хватит ли 128 гб памяти или нет?
Тогда может упасть accuracy так как взаимосвязей между категориальными фичами будет меньше. Наверно вопрос сводится к банальному, хватит ли 128 гб памяти или нет?
Ну это понятно, только цена вопроса обычно стоит этой просадки в проме