Size: a a a

RL reading group

2020 October 06

ОС

Олег Свидченко... in RL reading group
Доброго. Это похоже на Imitation Learning или Inverse RL (как сказали выше). Как минимум стоит посмотреть на DeepMimic (https://xbpeng.github.io/projects/DeepMimic/2018_TOG_DeepMimic.pdf), т.к. очень похоже на описание
источник
2020 October 07

N

Nazar in RL reading group
Олег Свидченко
Доброго. Это похоже на Imitation Learning или Inverse RL (как сказали выше). Как минимум стоит посмотреть на DeepMimic (https://xbpeng.github.io/projects/DeepMimic/2018_TOG_DeepMimic.pdf), т.к. очень похоже на описание
Я согласен, что похоже на Inverse RL, но Inverse RL более простая задача. Отличие в том что мы не можем  в случае обучения от второго лица взять траекторию эксперта и подставить ее в функцию правдоподобие модели агента.
источник

DE

Denis E in RL reading group
Nazar
Доброго дня! кому-нибудь знает статьи по RL с обучением от второго лица? то есть это когда агент со стороны наблюдает, как взаимодействуют со средой (но не знает какие при этом действия совершаются и какие это состояния), а потом он пробует повторить, сопоставляя свию действия и состояния с теми что были на видео. Я пока не нашел подобных статей, но кажется тема интересная, новый способ обучения получается.
Есть ещё observational learning
источник

DE

Denis E in RL reading group
источник
2020 October 10

E

Egor in RL reading group
Pavel Shvechikov
Посоветуйте, если знаете хороший
источник
2020 October 14

SK

Sergey Kolesnikov in RL reading group
на правах налгой рекламы 😂
ну а на самом деле просто рад
источник

SK

Sergey Kolesnikov in RL reading group
Check out write-up from ARRIVAL on PyTorch Medium blog to learn how to use Deep Reinforcement Learning to train robots in simulation and solve your own real-life tasks!
Powered by Catalyst.RL framework 🔥
https://medium.com/pytorch/robotic-assembly-using-deep-reinforcement-learning-dfd9916c5ad7
источник

SA

See All in RL reading group
😓я думал тут будет релиз лайтнинга 1.0
источник

IM

Ilya Melnikov in RL reading group
Круто что это работает, но, как обычно для таких штук, не хватает сравнения с классическими подходами к управлению. Как-никак, роботы сейчас работают очень точно, а здесь видно дрожание манипулятора. Хочется понимать, насколько RL подход далек от SOTA в этой задаче.
источник
2020 October 15

SS

Sergey Sviridov in RL reading group
See All
😓я думал тут будет релиз лайтнинга 1.0
источник
2020 October 17

SK

Sergey Kolesnikov in RL reading group
btw, через 20 минут будем запускать RL + Catalyst секции Datafest
будет Shangtong Zhang из WhiRL про Off policy рассказывать
источник

SK

Sergey Kolesnikov in RL reading group
если что
link: https://spatial.chat/s/ods
password: allhailtheoneandonlypartyparrot
room: Catalyst
источник
2020 October 26

it

igor tokarev in RL reading group
Народ, всем приветы) Подскажите решение для след задачи. Подразумевается создание большой системы с количеством агентов ~ 1000. Нужно обучить агентов делать оптимальные действия в условиях того, что агенты могут отключаться и включаться независимо.
Ну и самое главное - чтобы тренировать такую систему как можно быстрее и проще.
источник

HS

Heis Shadrach in RL reading group
Translate
источник

MS

Michael Solotky in RL reading group
igor tokarev
Народ, всем приветы) Подскажите решение для след задачи. Подразумевается создание большой системы с количеством агентов ~ 1000. Нужно обучить агентов делать оптимальные действия в условиях того, что агенты могут отключаться и включаться независимо.
Ну и самое главное - чтобы тренировать такую систему как можно быстрее и проще.
Ох, сложно
Выглядит как Impala, только multi agent
источник
2020 November 12

VL

Vadim Liventsev in RL reading group
cydoroga
Всем привет!
Обещанного ждут три года)
Мы таки запускаем курс лекций по Advanced RL

В рамках курса пройдет несколько докладов на разнообразные темы продвинутого RL, в их числе:
- Hierarchical RL
- Meta learning, Transfer and Multi-task RL
- Distributed RL
- Distributional RL
- Exploration in RL
- Memory in RL, POMDP
- Model-based RL
- Multi-Agent RL
- RL for combinatorial optimization
- Immitation and Inverse RL
- Genetic and Evolutionary RL
- Variational Inference in RL

Первая лекция состоится уже в следующий четверг (13го февраля).
На лекции выступит Сергей Иванов и расскажет про Exploration в RL.
Как обычно, встречаемся в ШАДе.
13е февраля, 19:00
Аудитория: Оксфорд

Если вы хотите прийти, обязательно зарегистрируйтесь в форме по ссылке!
https://docs.google.com/forms/d/e/1FAIpQLSd18PGkZuOqkWThJhmNxnmiSVFicnH4YwLVTCOkEkVQV6ZIDg/viewform

Сергей расскажет о том, что такое self-supervised режим в обучении с подкреплением и как с его помощью можно мотивировать агента исследовать окружающую среду. Обсудим преимущества введения такой "внутренней мотивации" (intrinsic motivation) RL-агентам и каких нежелательных эффектов мы при этом наоборот стремимся избежать на примере таких центральных подходов, как любопытство (Curiosity) и дистилляция случайной сетки (Random Network Distillation).


ПС !!!
Данный курс лекций будет проходить почти как нормальный университетский курс. Вы можете послушать лекции и сделать проект (про проекты расскажем позже).

Студенты ШАДа смогут зачесть успешно сданный курс как полусеместровый в ШАДе.
За подробностями пишите мне.

Студенты МФТИ могут зачесть данный курс лекций + проект как курс МФТИ.
За подробностями пишите @supergriver

Всем остальным за прохождение курса мы дадим красивые дипломы и может быть красивый мерч :)

Если вы хотите поучаствовать в выполнении проектов, пожалуйста, пройдите регистрацию в еще одной форме:
https://forms.gle/jpxWUSxfdCmqoGdY8

Также мы создали чат, в котором будет обсуждение только (!) деталей курса, проектов, лекций. Все, чем не стоило бы захламлять основной чат.
https://t.me/adv_topics_in_rl_ru_2020

ПСС
По всем вопросам пишите мне (@cydoroga), Артему Сорокину (@supergriver), Сергею Свиридову (@sergeysviridov) и Сергею Колесникову (@scitator).
мы сейчас обсуждаем этот курс в режиме испорченного телефона на пятничных семинарах по RL :) (и разные другие вещи)

всех рады видеть einreise.tilda.ws
источник

KS

Konstantin Sozykin in RL reading group
Vadim Liventsev
мы сейчас обсуждаем этот курс в режиме испорченного телефона на пятничных семинарах по RL :) (и разные другие вещи)

всех рады видеть einreise.tilda.ws
а это 2 или 3 часа с Москвой разница?
источник

VL

Vadim Liventsev in RL reading group
2
источник

VL

Vadim Liventsev in RL reading group
начало в 15:00 по Москве
источник
2020 November 13

it

igor tokarev in RL reading group
Народ, всем приветы) Кто-нибудь пробовал MADDPG и QMIX? Кто лучше результаты показывает? Что лучше использовать, если нужно много агентов, причём сами агенты должны быть разные.
источник