Size: a a a

RL reading group

2020 January 09

AP

Anton Pechenko in RL reading group
у тебя есть прирост качества или просто ничего не меняется?
источник

IK

Ivan Kapranov in RL reading group
на каких-то средах ничегл, на некоторых чуть быстрее достигается аналогичное качество, на некоторых есть прирост
источник

AP

Anton Pechenko in RL reading group
ясно, ну ок, сложно что-то сказать, надо смотреть детально чтобы что-то понять
источник

IK

Ivan Kapranov in RL reading group
ну вот поэтому и ищу мб кто-то уже делал такое в отрыве от RL)
источник

P

Pavel Shvechikov in RL reading group
В контексте RL эффект может быть связан с более точным обучением смежных значений функции ценности — распространением назад более правильного значения за счет поправки значения будущего.
Но я бы все равно ожидал деградации при увеличении длины отрезка эпизода, помещающегося в батч.
Если в твоем методе этого не происходит — пиши статью ))
Отчасти, эффект может также связан с тем, что любая аппроксимация нейронками делает стейт "немного" немарковским. За счет явного учитывания этого эффекта можно добиться улучшения результатов даже на 4-frame-stacked Atari играх.

В отрыве от RL, можно посмотреть на приоритезацию обучения с неравномерным выбором элементов батча. Наверняка, в related work похожих статей найдешь что-то полезное.
источник

IK

Ivan Kapranov in RL reading group
Спасибо)
источник

P

Pavel Shvechikov in RL reading group
мдааас
источник

CP

Cherry Pie in RL reading group
Откуда?
источник

P

Pavel Shvechikov in RL reading group
Cherry Pie
Откуда?
источник

CP

Cherry Pie in RL reading group
Мерси :)
источник
2020 January 11

AP

Anton Pechenko in RL reading group
Всем привет! А подскажите статьи где gym humanoid-v2 побеждают?
источник

P

Pavel Shvechikov in RL reading group
Anton Pechenko
Всем привет! А подскажите статьи где gym humanoid-v2 побеждают?
А что значит побеждают?
Насколько мне известно из reproducible алгоритмов sota на нем это SAC.
источник

AP

Anton Pechenko in RL reading group
В этой статье Humanoid-v1, а мне нужен v2, может кто-то знает чем они отличаются?
источник

AP

Anton Pechenko in RL reading group
Pavel Shvechikov
А что значит побеждают?
Насколько мне известно из reproducible алгоритмов sota на нем это SAC.
А можешь еще статей подсказать где есть эта среда, просто не в каждой статье встречается, мне хочется посмотреть кто с какими гиперпараметрами обучает
источник

AP

Anton Pechenko in RL reading group
Если вдруг что-то на ум приходит
источник

P

Pavel Shvechikov in RL reading group
[1812.05905] Soft Actor-Critic Algorithms and Applications
https://arxiv.org/abs/1812.05905
источник

P

Pavel Shvechikov in RL reading group
Anton Pechenko
В этой статье Humanoid-v1, а мне нужен v2, может кто-то знает чем они отличаются?
Там v2
источник

P

Pavel Shvechikov in RL reading group
Переслано от Pavel Shvechikov
нет.
v1 vs v2 это обновление до mujoco 1.5
источник

P

Pavel Shvechikov in RL reading group
Переслано от Pavel Shvechikov
v2 vs v3 это изменение интерфейса и поддержка конфигурации среды через кварги при созаднии (например штраф контрол коста)
источник

P

Pavel Shvechikov in RL reading group
Но не все так просто.
Некоторые v3 отличаются от v2 ещё и дефолтными параметрами (тонкостей не помню уже, но они не для всех энвов сравнимы, кажется Ант был другой)
источник