Size: a a a

RL reading group

2021 April 20

AY

Alexey Yurasov in RL reading group
Интересно!👍
источник

kk

k k in RL reading group
Ребят, объясните мне пожалуйста, а зачем во все тутриалы RL добавляют графику ? Почему нельзя смотреть на эксперимент в консоли ?
источник

kk

k k in RL reading group
В черном окне
источник

A

Anton in RL reading group
(во-первых, это красиво)
источник

MM

Michael Melnik in RL reading group
На то и туториал, чтобы было понятно что пытаемся обучить. Если говорить о возможности мониторинга результатов обучения, то в тех же туториалах также и графики рисуют (как в рамках python инструментов, так и в tensorboard)
источник

AY

Anton Your Only Vice in RL reading group
Подскажите красивые библиотеки визуализации RL
источник
2021 April 21

Gꙮ

George ꙮ in RL reading group
А что вы хотите визуализировать?
источник

AY

Anton Your Only Vice in RL reading group
процесс обучения, например активацию нейронов
источник

AY

Anton Your Only Vice in RL reading group
просто покидайте что-нибудь для визуализации, я пока сам не знаю чего конкретно ищу
источник

SA

See All in RL reading group
источник

AY

Anton Your Only Vice in RL reading group
да я w&b использую для таких графиков
источник

AY

Anton Your Only Vice in RL reading group
скучно че-то
источник

DS

Dmitry Sorokin in RL reading group
Пробовал ли кто-то решать задачи по типу gym FetchPickAndPlace-v1 (захвата и переноса предметов в симуляции) чистым PPO? Мне кажется, что такая задача вообще не особо решается без hierarchical experience replay или behaviour cloning. Или тут можно наинженирить реворд, чтобы работало?
источник
2021 April 22

kk

k k in RL reading group
Ребят, а многорукие бандиты это RL ?
источник

DK

Dmitriy Krylov in RL reading group
обычно говорят, что они частный случай
источник

RB

Roman Beltyukov in RL reading group
Есть хорошая картинка, объясняющая разницу
источник

АС

Артём С in RL reading group
Обычно бандиты и правда считаются частью RL'я, но я не убеждён, что в таком включении много смысла. Разве кто-либо использует методы полноценного RL'я (DQN, например) для бандитов?
источник

c

cydoroga in RL reading group
Скорее мечтают сделать наоборот)
источник

AM

Aynur Maksutov in RL reading group
Всё вписывается, нет? Action - выбор ручки, State - состояние автомата с конкретно выбранной ручкой, Reward - следствие состояния.

Да, вырожденный случай: (1) reward после каждого действия (2) action легко и однозначно отображается в полученный state, но разве оттого схема ломается? Ну просто environment простой получается.
источник

RB

Roman Beltyukov in RL reading group
Более-менее вписывается, да, поэтому и считают бандитов ближе к RL, чем к supervised, например, имхо.
источник