Size: a a a

RL reading group

2020 April 01

AS

Artyom Sorokin in RL reading group
Переслано от Sergey Sviridov
Коллеги, завтрашняя лекция по личным причинам переносится на следующую неделю! Всем хорошей смоизоляции)
источник

c

cydoroga in RL reading group
Переслано от cydoroga
А на этой неделе вечер четверга можно занять выполнением проектов по курсу!

Сорри за нестыковки.
Посыпаем голову пеплом.
Со следующей недели все по расписанию, это единоразовая мера.
источник
2020 April 02

P

Pavel Shvechikov in RL reading group
Очень понравился список докладчиков и темы докладов, есть видео с прошлого года.
L4DC: Learning for Dynamics and Control
источник
2020 April 03

DC

Dany Chepenko in RL reading group
А трансляции зума где-нибудь выложены?
источник

DC

Dany Chepenko in RL reading group
На ютубе не нашёл в канале
источник

AS

Artyom Sorokin in RL reading group
Выложим когда будет готова
источник

DC

Dany Chepenko in RL reading group
Отлично, спасибо!
источник
2020 April 06

P

Pavel Shvechikov in RL reading group
источник

EK

Evgeny Kashin in RL reading group
🔥
источник
2020 April 07

AS

Artyom Sorokin in RL reading group
Переслано от Artyom Sorokin
Из-за технических проблем мы несколько недель не выкладывали новые лекции,. Но за последнюю неделю+ смогли выложить сразу три!
Если кто не следит за youtube каналами, то вот они.

@ipaulo рассказывает про Distributional RL наслаждаясь преимуществами живой аудитории в последнюю неделю до карантина:
https://www.youtube.com/watch?v=aNE2UWaOfpQ&list=PLt1IfGj6-_-eXjZDFBfnAhAJmCyX227ir

@vitaminotar, в аудитории с двумя живыми зрителями, рассказывает о способах применения RL для получения приближенных решений NP-сложных задач:
https://www.youtube.com/watch?v=9wXe-dJPtV4&list=PLt1IfGj6-_-eXjZDFBfnAhAJmCyX227ir&index=6

@cydoroga, в полностью пустой аудитории, математически обосновывает интуицию лежащую в основе Maximum Entropy RL и таких алгоритмов как SAC и Soft Q-learning
https://www.youtube.com/watch?v=_ZGUxbe_s6Y&list=PLt1IfGj6-_-eXjZDFBfnAhAJmCyX227ir&index=7

Все лекции можно найти на этих каналах:
https://www.youtube.com/playlist?list=PLt1IfGj6-_-eXjZDFBfnAhAJmCyX227ir
https://www.youtube.com/channel/UC6KYPBaACVG0pkBWH5bkWLQ/videos
источник

AS

Artyom Sorokin in RL reading group
Same Energy
источник

AS

Artyom Sorokin in RL reading group
источник

S

Sebastian in RL reading group
источник
2020 April 08

c

cydoroga in RL reading group
Попытка вторая!
Приходите, будет интересно!
источник

c

cydoroga in RL reading group
Переслано от cydoroga
Всем привет!
В уже привычном формате онлайн-трансляции на этой неделе состоится восьмая лекция курса Advanced RL.
Запись, как обычно, будет еще и на youtube.

В четверг
В 19:00
Ссылку на трансляцию мы выложим в чат перед трансляцией.

На лекции выступит Сергей Свиридов @sergeysviridov.

Тема: Multi-Agent RL

Поговорим об основных направлениях в мультиагентном обучении с подкреплением, в частности  фокус будет направлен на обучение в POMDP средах.

Подключайтесь, будет интересно!

И, пожалуйста, зарегистрируйтесь по ссылке.
Мы вас все-равно пустим, и вам все-равно рады, просто интересно 😌
https://docs.google.com/forms/d/e/1FAIpQLSd18PGkZuOqkWThJhmNxnmiSVFicnH4YwLVTCOkEkVQV6ZIDg/viewform

ПС
Вопросы во время трансляции предлагается задавать через микрофон или чат Zoom.
Чтобы не возникало лишнего побочного шума и неразберихи, огромная просьба следить за тем, что ваш микрофон выключен во время трансляции, если вы в данный момент не задаете вопрос :)
источник
2020 April 09

c

cydoroga in RL reading group
Ссылка на конференцию:
https://zoom.us/j/726273474

Подключайтесь!
Начнем в 19:05
источник

c

cydoroga in RL reading group
Ссылка на сегодняшнюю презентацию
https://slides.com/sergeysviridov/mdrl
источник
2020 April 13

ZZ

Zigfrid Zvezdin in RL reading group
У меня есть алгоритм, скажем, Linear Q Learning. У меня есть много партий, сыгранных людьми. Для простоты будем считать, что это шахматные партии и что я обучаю только игрока, играющими за белых.
Как инициализировать веса агента с помощью данных?
источник

AG

Aleksey Grinchuk in RL reading group
1. Нужно задать как-то признаковые описания пар «состояние-действие». Если состояния — это векторы из R^d, а действий A, то можно каждую пару «состояние-действие» представить в виде блочного вектора из R^{d*A}, где на месте других действий будут стоять нули, а на месте предпринятого действия — вектор состояния размера d.
2. Составить признаковые матрицы для пар (s, a) и следующих за ними пар (s’, a’). Получится две матрицы Ф и Ф’ размера N x (dA).
3. Решить систему линейных уравнений
Фw = r + yФ’w <=> (Ф-уФ’)w=r
каким-то итеративным методом или просто попробовать домножить вектор наград r на псевдообращение матрицу (Ф-уФ’)
4. Использовать полученное решение w в качестве инициализации
источник

ZZ

Zigfrid Zvezdin in RL reading group
Aleksey Grinchuk
1. Нужно задать как-то признаковые описания пар «состояние-действие». Если состояния — это векторы из R^d, а действий A, то можно каждую пару «состояние-действие» представить в виде блочного вектора из R^{d*A}, где на месте других действий будут стоять нули, а на месте предпринятого действия — вектор состояния размера d.
2. Составить признаковые матрицы для пар (s, a) и следующих за ними пар (s’, a’). Получится две матрицы Ф и Ф’ размера N x (dA).
3. Решить систему линейных уравнений
Фw = r + yФ’w <=> (Ф-уФ’)w=r
каким-то итеративным методом или просто попробовать домножить вектор наград r на псевдообращение матрицу (Ф-уФ’)
4. Использовать полученное решение w в качестве инициализации
Кажется, что можно тут заменить
init parameter-vector w with zeros
for each episode in played games:
2. a <- chosen action
at state s
3. s' <- next state in episode
4. w <- w + alpha * (G - Q(s,a)) * grad(Q(s,a))

где G - полученный return в конце партии
источник