Size: a a a

RL reading group

2020 January 18

AM

Aynur Maksutov in RL reading group
В Тиньке хотят применять РЛ, кое-какие наработки уже есть. Если надо, могу сконтачить с нужными людьми
источник

SK

Sergey Kolesnikov in RL reading group
Aynur Maksutov
В Тиньке хотят применять РЛ, кое-какие наработки уже есть. Если надо, могу сконтачить с нужными людьми
любопытно,
а можно подробнее?)
источник

SS

Sergey Sviridov in RL reading group
источник

CP

Cherry Pie in RL reading group
источник

SK

Sergey Kolesnikov in RL reading group
кто-то спрашивал на Yandex.NeurIPS за AlphaFold
https://github.com/deepmind/deepmind-research/tree/master/alphafold_casp13
источник
2020 January 20

NK

Nikita Kostin in RL reading group
Да, видели, спасибо! Следим за твиттером Хассабиса: https://twitter.com/demishassabis/status/1217512436548325378?s=21
источник

AG

Alexander Grishin in RL reading group
Коллеги, а есть ли кто-то, запускающий в качестве бейзлайна ванильный PPO на MuJoCo? Возникла проблема, чтобы воспроизвести, например, такие результаты на PPO с помощью baselines.
источник

IB

Ivan Baskov in RL reading group
Alexander Grishin
Коллеги, а есть ли кто-то, запускающий в качестве бейзлайна ванильный PPO на MuJoCo? Возникла проблема, чтобы воспроизвести, например, такие результаты на PPO с помощью baselines.
источник

AG

Alexander Grishin in RL reading group
Гляну, спасибо!
источник
2020 January 22

АЯ

Амир Ягудин... in RL reading group
запускаю rllib с observation_space Discrete(21), внутри он one-hot препроцессится. Обучается намного лучше, чем если obs_space, Box(0, 21, shape=(1,)). Но во втором случае размерность меньше, и obs_space идейно можно считать упорядоченным, поэтому его представление в виде одного числа уместно. С чем это может быть связано?
источник

АЯ

Амир Ягудин... in RL reading group
после нормализации, оба случая стали идентичны)
источник

P

Pavel Shvechikov in RL reading group
Подскажите, пожалуйста, а была ли статья про использование Double Q-learning оценки для continuous control?
источник

AG

Aleksey Grinchuk in RL reading group
В TD3 же две сети используют как раз для этого. Или это не про то?
источник

P

Pavel Shvechikov in RL reading group
Там min(Q1, Q2)
Хочется нормальных резов для  Q1(argmax(Q2)), не могу их найти
источник

P

Pavel Shvechikov in RL reading group
Нашел резы для double оценки в TD3 ablation табличке, спасибо
источник
2020 January 23

SK

Sergey Kolesnikov in RL reading group
гайз, а какие нынче best practices для off-policy evaluation?
<ну, не сразу же катить, you know>
источник
2020 January 24

P

Pavel Shvechikov in RL reading group
Про best practices не могу сказать. Из последнего, я бы глянул сюда
источник

P

Pavel Shvechikov in RL reading group
Переслано от Pavel Shvechikov
Gendice: Generalized Offline Estimation Of Stationary Values
"Our approach is based on estimating a ratio that corrects for the discrepancy between the stationary and empirical distributions, derived from fundamental properties of the stationary distribution, and exploiting constraint reformulations based on variational divergence minimization"
источник
2020 January 25

SI

Savva Ignatyev in RL reading group
Где-то читал или видел, такой трюк, при обучении CNN на больших датасетах берут два примера из разных классов (скажем собаку и кошку), линейно их интерполируют (a+b)/2 и для полученного изображения лепят two-hot метку (0, 0.5, 0, 0, 0.5). Добавление таких примеров в выборку эмпирически помогает
источник

SI

Savva Ignatyev in RL reading group
Не напомните название статьи или же тег?
источник