Size: a a a

2020 December 25

AU

Aleksei Ustimenko in catboost_ru
Andrew
Привет, поделитесь свои опытом, если мне в задаче ранжирования важно только верное определение топ-1, то какие целевые функции стоит пытаться перебирать? Из чтения доков показалось, что можно пробовать только QuerySoftMax и YetiRankPairwise, есть ли истории успеха с другими целевыми лоссами? Еще 1 специфика: для примеров в группе есть оценки "плохости" x из  [0;+inf), если я сделаю лейблы -x, то будут ли автоматом веса пар браться на основании x_1 - x_2 (ну или exp(x_1 - x_2) или exp(x_1) - exp(x_2), просто чтобы учитывало, насколько хуже станет итоговый скор). На всякий случай, в итоге, оптимизирую средний x по датасету.
loss-function StochasticRank:metric=DCG;top=1;type=Position;samples=10 (поставить на 1, если слишком долго)
источник

AU

Aleksei Ustimenko in catboost_ru
Попробуйте
источник

AU

Aleksei Ustimenko in catboost_ru
Оно теоретически гарантирует оптимизацию DCG
источник

AU

Aleksei Ustimenko in catboost_ru
Оно вроде как и отрицательные таргеты умеет
источник

AU

Aleksei Ustimenko in catboost_ru
просто сделать отрицательный лейбл и вперед ранжировать
источник

AU

Aleksei Ustimenko in catboost_ru
но смысла не имеет вообще говоря
источник

A

Andrew in catboost_ru
А YetiRank не будет нехуже? Мне казалось, что это более продвинутый вариант оптимизации  целевых функций того же типа.
источник

AU

Aleksei Ustimenko in catboost_ru
Andrew
А YetiRank не будет нехуже? Мне казалось, что это более продвинутый вариант оптимизации  целевых функций того же типа.
Они когда кто
источник

AU

Aleksei Ustimenko in catboost_ru
3/4 датасетов - йети
источник

AU

Aleksei Ustimenko in catboost_ru
1/4 - стохастик
источник

AU

Aleksei Ustimenko in catboost_ru
если брать DCG@5
источник

AU

Aleksei Ustimenko in catboost_ru
на DCG@1 стохастик может вести себя куда лучше
источник

AU

Aleksei Ustimenko in catboost_ru
ЙетиРанк, хоть и нереально крутой и мощный, не имеет возможности оптимизировать именно конкретную метрику, но да, в 3/4 случаев он заоптимизирует любую какую хотите ранжирующую
источник

AU

Aleksei Ustimenko in catboost_ru
Стохастик же был создан именно чтоб ударить по конкретной метрике
источник

A

Andrew in catboost_ru
Круто, спасибо!
источник

AU

Aleksei Ustimenko in catboost_ru
Andrew
Круто, спасибо!
А, да, не закончил мысль, если у вас DCG@1 то можно добавить ко всем таргетам положительную константу чтоб они все стали неотрицательные - формула обучится ровно та же самая, как если бы там были бы реальные отрицательные (но это только Стохастика касается, Йети будет просто пытатсья разнести друг от друга пары документов, если у них разный таргет, не обращая внимания на их знак)
источник

R

Romirozzz in catboost_ru
Добрый день. А под Apple m1 собирается?
источник

SK

Stanislav Kirillov in catboost_ru
пока нет, но мы обязательно сделаем как только соберем стенд под сборку и отладку
источник

SK

Stanislav Kirillov in catboost_ru
А у вас уже есть железо?
источник

R

Romirozzz in catboost_ru
Есть. С нетерпением жду хоть один градиентный бустинг =) tensorflow уже есть работающий...
источник