ВК
Size: a a a
ВК
d
L
SK
SK
SK
L
SK
SK
SK
SK
L
AC
d
TB
def fit_model(train_pool, test_pool, **kwargs):
model = CatBoostClassifier(
random_seed=0,
max_ctr_complexity=1,
task_type='GPU',
iterations=10000,
eval_metric='AUC',
od_type='Iter',
od_wait=500,
learning_rate=0.03,
**kwargs
)
return model.fit(
train_pool,
eval_set=test_pool,
verbose=1000,
plot=False,
use_best_model=True
)
model_embeddings = fit_model(
train_pool, test_pool,
dictionaries = [{
'dictionaryId': 'Unigram',
'max_dictionary_size': '50000',
'gram_count': '1',
},{
'dictionaryId': 'Bigram',
'max_dictionary_size': '50000',
'gram_count': '2',
}]
)
CatBoostError: catboost/private/libs/options/text_processing_options.cpp:75: DictionaryOptions: no dictionary_id was specified
SK
SK
dictionaryId => dictionary_idTB
model_embeddings = fit_model(
train_pool, test_pool,
dictionaries = [{
'dictionary_id': 'Unigram',
'max_dictionary_size': '50000',
'gram_count': '1',
},{
'dictionary_id': 'Bigram',
'max_dictionary_size': '50000',
'gram_count': '2',
}]
)
TB
ND
dictionaries нужно еще указать tokenizers и feature_calcerstokenizers=[{'tokenizer_id': 'Space'}],
dictionaries = [{
'dictionary_id': 'Unigram',
'max_dictionary_size': '50000',
'gram_count': '1',
},{
'dictionary_id': 'Bigram',
'max_dictionary_size': '50000',
'gram_count': '2',
}],
feature_calcers=['BoW']