Size: a a a

RL reading group

2021 April 22

АС

Артём С in RL reading group
Так и обучение с учителем в RL можно вписать
state = картинка
action = логиты классификатора
reward = минус логлосс
источник

RB

Roman Beltyukov in RL reading group
Ну, если у тебя ревард выдается каждый ход, нет credit assignment problem, нет зависимости следующих действий от предыдущих, ломающих тебе весь теоретический градиентный спуск из-за отсутствия i.i.d, то в целом... :D
источник

KS

Konstantin Sozykin in RL reading group
я видел  такие статьи
источник

АС

Артём С in RL reading group
Вот-вот, а от всей сложности RL'я и не остаётся ничего
источник

RB

Roman Beltyukov in RL reading group
Сходу нашлась вот такая статья: https://arxiv.org/pdf/1901.08654.pdf, там PPO + assistive multi armed bandits
источник

KS

Konstantin Sozykin in RL reading group
минус логлосс - это так по русски
источник

KS

Konstantin Sozykin in RL reading group
источник

SI

Savva Ignatyev in RL reading group
lol
источник

АС

Артём С in RL reading group
Ну я, конечно, имел в виду категориальное лог-правдоподобие, но решил упростить
источник

PK

Petr Kuderov in RL reading group
Эта задача активно рассматривается в том числе и в рл, так как является важной составляющей более типичной задачи марковского процесса принятия решений (мппр). Можете думать о ней как о вырожденном частном случае мппр. Самое важное отличие - отсутствие состояния.
источник

c

cydoroga in RL reading group
и времени)
источник

A

Alexandr Notchenko in RL reading group
Если кому то интересние узнать о паралелях в исследовании оптимального контроля в США и СССР, рекомендую почитать эту статью
https://www.math.uni-bielefeld.de/documenta/vol-ismp/48_pesch-hans-josef-cold-war.pdf
источник

SS

Sergey Sviridov in RL reading group
*оптимального управления
источник

PK

Petr Kuderov in RL reading group
хах, как бы еще избавиться от привычки говорить политика вместо стратегии :)
источник

АС

Артём С in RL reading group
КГБ бы быстро избавило
источник
2021 April 23

AY

Anton Your Only Vice in RL reading group
l li
ll l_
источник
2021 April 27

SK

Sergey Kolesnikov in RL reading group
сап чат, собираю спикеров на Datafest 2021 по
1. Catalyst
2. Reinforcement Learning
кто готов выступить, рассказать интересный кейс, или у кого есть просто прикольная кулстори для комьюнити - welcome
https://forms.gle/taxWCeDPYo2vyzRZ9
источник
2021 April 28

DN

Dmitry Nikulin in RL reading group
А кто-то может прокомментировать, откуда в AlphaZero и MuZero взялись формулы для UCB? На скринах:

(1) Формула из ШАДовского семинара, которая получается из Hoeffding inequality
(2) Формула из AlphaZero
(3) Формула из MuZero

Почему вообще можно учить коэффициент P(s, a) перед UCB? Почему он должен быть пропорционален вероятности действия a? Почему знаменатель не под корнем? Что за +1 в знаменателе? Что за странный коэффициент появился в MuZero?
источник

DN

Dmitry Nikulin in RL reading group
источник

DN

Dmitry Nikulin in RL reading group
источник