Size: a a a

2021 February 13

Аa

Андрей amber4eg... in catboost_ru
хотя я не обратил внимание на Pool - вроде бы его сервис в явном виде не использует
источник

AK

Andrew Kolesnichenko in catboost_ru
при каждом предикте создается пул
я запускал это на отдельном инстансе с 1 гигом оперативки в авс и через часок-другой все падало
источник

AK

Andrew Kolesnichenko in catboost_ru
Влад
Может память лежит в кешэ LFAlloc?
а как очистить этот кеш?
источник

В

Влад in catboost_ru
Andrew Kolesnichenko
а как очистить этот кеш?
Да фиг знает, я про то, что может он преаллоцирует до какого-то значения (например 200 мб) а потом сам сбрасывает, как это видно на скриптах в ишью, но это лишь мои догадки
источник

SK

Stanislav Kirillov in catboost_ru
Посмотрим, это не дело
источник

AK

Andrew Kolesnichenko in catboost_ru
Влад
Да фиг знает, я про то, что может он преаллоцирует до какого-то значения (например 200 мб) а потом сам сбрасывает, как это видно на скриптах в ишью, но это лишь мои догадки
у меня все забивалась до конца(
источник

AK

Andrew Kolesnichenko in catboost_ru
Stanislav Kirillov
Посмотрим, это не дело
спасибо!
источник

В

Влад in catboost_ru
А вот есть функция ConvertFloatCatFeatureToIntHash, насколько я понял она используется только в r-биндингах, а если мы модельку учим на питоне или через cli, то все категориальные признаки - строки (целые числа приводятся к строке).
Меня смущает строчка в c++api
Flat here means that float features and categorical feature are in the same float array.
источник
2021 February 14

TB

Taras B in catboost_ru
странная ошибка - про что она?
---------------------------------------------------------------------------
~/.pyenv/versions/3.8.6/lib/python3.8/site-packages/catboost/core.py in _sum_models(self, models_base, weights, ctr_merge_policy)
  1376             weights = [1.0 for _ in models_base]
  1377         models_inner = [model._object for model in models_base]
-> 1378         self._object._sum_models(models_inner, weights, ctr_merge_policy)
  1379         setattr(self, '_random_seed', 0)
  1380         setattr(self, '_learning_rate', 0)

_catboost.pyx in _catboost._CatBoost._sum_models()
_catboost.pyx in _catboost._CatBoost._sum_models()
CatBoostError: catboost/libs/model/model.cpp:558: Too many features in model, ask catboost team for support

фичей 31 всего
источник

AK

Andrey Korzhun in catboost_ru
Taras B
странная ошибка - про что она?
---------------------------------------------------------------------------
~/.pyenv/versions/3.8.6/lib/python3.8/site-packages/catboost/core.py in _sum_models(self, models_base, weights, ctr_merge_policy)
  1376             weights = [1.0 for _ in models_base]
  1377         models_inner = [model._object for model in models_base]
-> 1378         self._object._sum_models(models_inner, weights, ctr_merge_policy)
  1379         setattr(self, '_random_seed', 0)
  1380         setattr(self, '_learning_rate', 0)

_catboost.pyx in _catboost._CatBoost._sum_models()
_catboost.pyx in _catboost._CatBoost._sum_models()
CatBoostError: catboost/libs/model/model.cpp:558: Too many features in model, ask catboost team for support

фичей 31 всего
Может фичи категориальные и дело в комбинациях?
Посмотрите на max_ctr_complexity
источник

TB

Taras B in catboost_ru
max_ctr_complexity = 5
источник

TB

Taras B in catboost_ru
50 моделей, если их сложить по десять, то проходит. получившиеся 5 можно попарно сложить. Или сложить последовательно
источник

TB

Taras B in catboost_ru
соврал. нельзя попарно и последовательно
источник

AK

Andrey Korzhun in catboost_ru
Taras B
max_ctr_complexity = 5
Попробуйте = 2
источник

TB

Taras B in catboost_ru
к еще у суммированных моделей нет predict_proba 🙂
AttributeError: 'CatBoost' object has no attribute 'predict_proba’
источник

IL

Ivan Lyzhin in catboost_ru
Taras B
к еще у суммированных моделей нет predict_proba 🙂
AttributeError: 'CatBoost' object has no attribute 'predict_proba’
Можно сконвертировать в CatboostClassifier с помощью метода to_classifier
источник

YV

Yuriy Vladimirovich in catboost_ru
Всем привет. Есть пару нубских вопросов.
1) К примеру, мы хотим понять, нужно ли оформление визы в страну Х. Есть список статей по теме, и нужно на их основе понять это. Похоже на классификацию да/нет. Реально ли это сделать с помощью CatBoost, или может быть другой технологии машинного обучения. И какая выборка нужна будет минимально для обучения? Или же лучше через https://github.com/natasha/yargy такие вещи делаются?
2) Можно ли имея список ключевых запросов и текст найти оптимальное место для простановки ссылки в этом тексте. То есть подобрать оптимальный анкор, без точного вхождения ключа. Чтобы искались не только прямые вхождения, но и с изменением формы, перестановкой слов, синонимы. Или лучше это делать другими инструментами?
источник
2021 February 16

CN

Crustacean Newman in catboost_ru
Добрый день, можете подсказать, есть ли возможность выставить свой bias?
источник

IL

Ivan Lyzhin in catboost_ru
scale и bias после обучения всегда (1, 0). Их можно проставить только у обученной модели.
источник

CN

Crustacean Newman in catboost_ru
Так я понимаю, это при boost_from_average=False
источник