Size: a a a

RL reading group

2020 March 19

TK

Taras Khakhulin in RL reading group
забыл слайды скинуть
источник
2020 March 22

P

Pavel Shvechikov in RL reading group
Кому интересен теория по risk sensitive RL?
источник

P

Pavel Shvechikov in RL reading group
Дорогие коллеги,

Наш семинар временно переходит в онлайн формат. Место встречи - Zoom (идентификатор будет выслан позже).
Время встречи: вторник 24 марта в 17:00

Максим Каледин (ВШЭ)

Risk-Sensitive Reinforcement Learning
a review of PhD thesis by Aviv Tamar

The main issue which keeps the applications of reinforcement learning limited is the fact that robustness, stability and durability of the learned decision policies are hard to prove. This happens due to usage of expected utility criterion which is optimized with respect to policy in all famous algorithms of RL. The criterium arised from economics and game theory where expected utility theory was historically the first well-established concept of rationality. Being very popular and well-studied in both mathematics and applications, the concept itself is not the only possible way to define rationality. In particular, there is more general class of functionals called coherent risk measures introduced in Delbaen,Artzner1998. Coherent risk measures are widely known in finance for they address exactly the robustness problem and try to quantify risk differently; despite that, in RL coherent risk measures are not so known and there are not so many papers on its usage. My talk would be devoted to the review of PhD thesis by Aviv Tamar on exploiting risk measures in RL which represents in itself a very comprehensive study on how to construct learning algorithms on popular risk measures like CVAR and semi-deviation.
источник

AS

Artyom Sorokin in RL reading group
👍
источник

vd

v d in RL reading group
Уважанмые коллеги!  Огрлмнпя поосьба проводить семинар НЕ во вторник. Начиная с 01 декабря 2015 мы по вторникам, с 17.00 проводим еженедельные замеданич «Котёл идей Нейрлнета». Мы, естественно, тоже переходим в онлайн. 24 марта - не успеваем подготовиться. А с 31-го будем. Нпши заседания - это эеспресс-скрининг новостей за неделю - arXiv (machine learning) и нейрлнауки (в основном Nature и Science₽. Так что большая просьба: после 24 марта не нпзначать RL на вторникм! - проф. В.Л. Дунин-Барковский (МФТИ/НИИСИ РАян)
источник
2020 March 23

VP

Violet Palii in RL reading group
всем привет! не знаю, насколько тут такое принято, но я с командой онлайн-хак организовываю 4-5 апреля (к 9 мая, кстати)

вдруг кому-то будет интересно, инфа с сайта https://bit.ly/2Wy0kuS, или добавляйтесь сразу в чат: https://bit.ly/2UzKXzg
источник
2020 March 25

c

cydoroga in RL reading group
Всем привет!
В уже привычном формате онлайн-трансляции на этой неделе состоится седьмая лекция курса Advanced RL.
Запись, как обычно, будет еще и на youtube.

В четверг (ЗАВТРА)
В 19:00
Ссылку на трансляцию мы выложим в чат перед трансляцией.

На завтрашней лекции выступит Павел Темирчев @cydoroga.

Тема: Variational Inference for RL

На лекции мы разберем интуицию, скрывающуюся за алгоритмами Soft q-learning и Soft Actor-Critic, довольно долго державшими позиции SOTA в continuous control.
Поговорим о том, как представить задачу максимизации награды в виде задачи вероятностного вывода.
И о том, как формулировка задачи RL в виде вероятностной графической модели может помочь лучше исследовать среду.
Также обсудим совсем уж новый подход K-learning, который демонстрирует, что у Soft методов, неожиданно, есть существенные проблемы с exploration.

Подключайтесь, будет интересно!

И, пожалуйста, зарегистрируйтесь по ссылке.
Мы вас все-равно пустим, и вам все-равно рады, просто интересно 😌
https://docs.google.com/forms/d/e/1FAIpQLSd18PGkZuOqkWThJhmNxnmiSVFicnH4YwLVTCOkEkVQV6ZIDg/viewform

ПС
Вопросы во время трансляции предлагается задавать через микрофон или чат Zoom.
Чтобы не возникало лишнего побочного шума и неразберихи, огромная просьба следить за тем, что ваш микрофон выключен во время трансляции, если вы в данный момент не задаете вопрос :)
источник
2020 March 26

AS

Artyom Sorokin in RL reading group
Переслано от Artyom Sorokin
Всем привет!
Лекция по Viarational Inference RL скоро начнется!
Чтобы подключиться к трансляции, проходите по ссылке.
Не забывайте выключить свой микрофон!

https://zoom.us/j/604877050?pwd=aHpITXZINkVyUVFOR0xzZm5GVFp2Zz09
источник

AV

Alexander Valiullin in RL reading group
А лекция будет записываться?
источник

AS

Artyom Sorokin in RL reading group
Да
источник

KT

Kirill Talalaev in RL reading group
А где лежат все записи?
источник

VM

Vladislav Myrov in RL reading group
источник

AS

Artyom Sorokin in RL reading group
источник

AS

Artyom Sorokin in RL reading group
Слайды на сегодняшнюю лекцию
источник

AS

Artyom Sorokin in RL reading group
Переслано от cydoroga
источник

АБ

Александр Белинский... in RL reading group
А на Ютубе только 4 лекции выложены, а ещё будут?
источник

AS

Artyom Sorokin in RL reading group
Будут
источник

AS

Artyom Sorokin in RL reading group
5 и 6 в процессе. 7 вот только что прошла
источник

АБ

Александр Белинский... in RL reading group
👍
источник
2020 April 01

c

cydoroga in RL reading group
Переслано от cydoroga
Всем привет!
В уже привычном формате онлайн-трансляции на этой неделе состоится восьмая лекция курса Advanced RL.
Запись, как обычно, будет еще и на youtube.

В четверг
В 19:00
Ссылку на трансляцию мы выложим в чат перед трансляцией.

На лекции выступит Сергей Свиридов @sergeysviridov.

Тема: Multi-Agent RL

Поговорим об основных направлениях в мультиагентном обучении с подкреплением, в частности  фокус будет направлен на обучение в POMDP средах.

Подключайтесь, будет интересно!

И, пожалуйста, зарегистрируйтесь по ссылке.
Мы вас все-равно пустим, и вам все-равно рады, просто интересно 😌
https://docs.google.com/forms/d/e/1FAIpQLSd18PGkZuOqkWThJhmNxnmiSVFicnH4YwLVTCOkEkVQV6ZIDg/viewform

ПС
Вопросы во время трансляции предлагается задавать через микрофон или чат Zoom.
Чтобы не возникало лишнего побочного шума и неразберихи, огромная просьба следить за тем, что ваш микрофон выключен во время трансляции, если вы в данный момент не задаете вопрос :)
источник