Всем привет!
Мы наконец выкладываем первую лекцию курса Advanced Topics in RL!
Exploration in RL:
Сергей Иванов рассказывает о том, что такое self-supervised режим в обучении с подкреплением и как с его помощью можно мотивировать агента исследовать окружающую среду. В лекции рассматриваются преимущества введения подобной "внутренней мотивации" (intrinsic motivation) для RL-агента и каких нежелательных эффектов при этом стоит избегать.
Лекцию можно посмотреть на youtube на любом из двух каналов:
RL Reading Group (
https://youtu.be/qvxgsxQFHgQ)
И
DeepPavlov (
https://youtu.be/8zZrciFXJM8)
Cсылки на разобранные статьи:
Random Network Distillation (
https://arxiv.org/abs/1810.12894)
Intrinsic Curiosity Module (
https://arxiv.org/abs/1705.05363,
https://arxiv.org/abs/1808.04355)
Episodic Curiosity through Reachability (
https://arxiv.org/abs/1810.02274)