Всем привет!
В уже привычном формате онлайн-трансляции на этой неделе состоится седьмая лекция курса Advanced RL.
Запись, как обычно, будет еще и на youtube.
В четверг (ЗАВТРА)
В 19:00
Ссылку на трансляцию мы выложим в чат перед трансляцией.
На завтрашней лекции выступит Павел Темирчев
@cydoroga.
Тема: Variational Inference for RL
На лекции мы разберем интуицию, скрывающуюся за алгоритмами Soft q-learning и Soft Actor-Critic, довольно долго державшими позиции SOTA в continuous control.
Поговорим о том, как представить задачу максимизации награды в виде задачи вероятностного вывода.
И о том, как формулировка задачи RL в виде вероятностной графической модели может помочь лучше исследовать среду.
Также обсудим совсем уж новый подход K-learning, который демонстрирует, что у Soft методов, неожиданно, есть существенные проблемы с exploration.
Подключайтесь, будет интересно!
И, пожалуйста, зарегистрируйтесь по ссылке.
Мы вас все-равно пустим, и вам все-равно рады, просто интересно 😌
https://docs.google.com/forms/d/e/1FAIpQLSd18PGkZuOqkWThJhmNxnmiSVFicnH4YwLVTCOkEkVQV6ZIDg/viewformПС
Вопросы во время трансляции предлагается задавать через микрофон или чат Zoom.
Чтобы не возникало лишнего побочного шума и неразберихи, огромная просьба следить за тем, что ваш микрофон выключен во время трансляции, если вы в данный момент не задаете вопрос :)