Size: a a a

RL reading group

2020 April 13

AG

Aleksey Grinchuk in RL reading group
Можно, получится Monte Carlo оценка. Скорее всего, очень шумная, но если данных много, то может быть нормально.
источник

ZZ

Zigfrid Zvezdin in RL reading group
Aleksey Grinchuk
Можно, получится Monte Carlo оценка. Скорее всего, очень шумная, но если данных много, то может быть нормально.
Данных не очень много, но и не очень мало: около 10К. Надеюсь, с инициализацией качество улучшится.
источник

IB

Ilya Boldyrev in RL reading group
Zigfrid Zvezdin
У меня есть алгоритм, скажем, Linear Q Learning. У меня есть много партий, сыгранных людьми. Для простоты будем считать, что это шахматные партии и что я обучаю только игрока, играющими за белых.
Как инициализировать веса агента с помощью данных?
Хочешь научить машину в бридж играть?)
источник

ZZ

Zigfrid Zvezdin in RL reading group
Ilya Boldyrev
Хочешь научить машину в бридж играть?)
Да, в этом идея)
источник
2020 April 15

c

cydoroga in RL reading group
Всем привет!
Завтра пройдет очередная, девятая, лекция курса по Advanced RL в виде трансляции.
Запись трансляции выложим на ютуб.

В четверг
В 19:00
Ссылку на трансляцию мы выложим в чат перед трансляцией.

На лекции выступит Евгений Кашин @digitman.

Тема: Model-Based RL

Поговорим о том, что это и зачем нужно, если есть Model Free. Вспомним, что такое планирование, и как его использовать, если знаем "модель среды". Что делать, если нет модели среды. Потом разберем несколько каноничных современных статей и вспомним Шмидхубера

Подключайтесь, будет интересно!

И, пожалуйста, зарегистрируйтесь по ссылке.
Мы вас все-равно пустим, и вам все-равно рады, просто интересно 😌
https://docs.google.com/forms/d/e/1FAIpQLSd18PGkZuOqkWThJhmNxnmiSVFicnH4YwLVTCOkEkVQV6ZIDg/viewform

ПС
Вопросы во время трансляции предлагается задавать через микрофон или чат Zoom.
Чтобы не возникало лишнего побочного шума и неразберихи, огромная просьба следить за тем, что ваш микрофон выключен во время трансляции, если вы в данный момент не задаете вопрос :)
источник

AS

Artyom Sorokin in RL reading group
Переслано от Artyom Sorokin
Восьмая лекция Advanced Topics in RL

Сергей Свиридов(@sergeysviridov) рассказывает о современных направления в многоагентном глубоком обучении с подкреплением, в частности фокус направлен на обучение в POMDP средах.

Лекцию можно посмотреть на youtube на любом из двух каналов:
DeepPavlov (https://youtu.be/dk8RT-GXPi4)
И
RL Reading Group (https://youtu.be/0OSvoYbWs9o)

Cсылки на разобранные статьи:
Stabilising Experience Replay for Deep Multi-Agent RL [https://arxiv.org/abs/1702.08887]
Counterfactual Multi-Agent Policy Gradients [https://www.cs.ox.ac.uk/people/shimon...]
Value-Decomposition Networks For Cooperative Multi-Agent Learning [https://arxiv.org/abs/1706.05296]
Monotonic Value Function Factorisation for Deep Multi-Agent RL [https://arxiv.org/abs/2003.08839v1]
Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments [https://arxiv.org/abs/1706.02275]

Слайды:
https://slides.com/sergeysviridov/mdrl#/
источник
2020 April 16

c

cydoroga in RL reading group
Ссылка на презентацию по сегодняшней лекции!
https://docs.google.com/presentation/d/1j1HzFdeqIUelpi5vJUay-yzL8ihERKLfLEdJDJtiQlo/edit?usp=sharing
источник

c

cydoroga in RL reading group
Переслано от cydoroga
Подключайтесь к трансляции:
https://zoom.us/j/92877211655?pwd=aXJoV2xYVWF2VkYxVXhuQUZET2ZzZz09
источник

c

cydoroga in RL reading group
В 19:05 начинаем
источник
2020 April 17

ZZ

Zigfrid Zvezdin in RL reading group
Задал вопрос на Cross Validated, продублирую тут, может быть, у кого-нибудь есть идеи.

I have a game where the length of an episode is fixed and small - 26 steps. The reward is assigned only once, at the end of the episode. State size has around 350 features; there are at maximum 52 actions.
Two questions:

* Are Monte Carlo methods better than Temporal Difference? I have an intuition that yes because Monte Carlo is the true sample of Q(s,a) and the episodes are short, thus we can update the weights quite quickly.
* How to keep track of previous states? Again, as the trajectories are small, I suggest that we could build a huge state S_t = [s_1, s_2, ..., s_t, 0, 0, ..., 0], where s_i is the "normal" state at step i and t is the current step. This would result in around 26*350=9100 features. Other option would be to use some LSTM and hope that the agent will memorize the past states.
источник

P

Pavel Shvechikov in RL reading group
Посмотри в сторону

1.  префиксных деревьев из https://www.deepstack.ai/

2. MCTS
источник

ZZ

Zigfrid Zvezdin in RL reading group
Спасибо!
источник
2020 April 20

NS

Nurlan Shagadatov in RL reading group
Коллеги, кто нибудь знает методы/метрики для сравнения нескольких рл алгоритмов на стабильность, сходимость?
источник

NS

Nurlan Shagadatov in RL reading group
Стабильность вплане во время обучения
источник

DN

Dmitry Nikulin in RL reading group
Nurlan Shagadatov
Коллеги, кто нибудь знает методы/метрики для сравнения нескольких рл алгоритмов на стабильность, сходимость?
источник

NS

Nurlan Shagadatov in RL reading group
Спасибо.
источник

PK

Petr Kuderov in RL reading group
Nurlan Shagadatov
Коллеги, кто нибудь знает методы/метрики для сравнения нескольких рл алгоритмов на стабильность, сходимость?
у дип майнда еще был фреймворк https://github.com/deepmind/bsuite. Он возможно не совсем по теме, но может и да
источник
2020 April 22

HB

Hi, Bombaklaat in RL reading group
Здравствуйте. Делал простенький эксперимент по статье: https://towardsdatascience.com/qrash-course-deep-q-networks-from-the-ground-up-1bbda41d3677

Кто-то может подсазать что я делаю не так? - https://github.com/nuqz/rl-experiment
источник
2020 April 23

c

cydoroga in RL reading group
Всем привет!
Завтра пройдет десятая лекция курса по Advanced RL в виде трансляции.
Запись трансляции выложим на ютуб.

В четверг
В 19:00
Ссылку на трансляцию мы выложим в чат перед трансляцией.

На лекции выступит Ëж @JustHeuristic

Тема: Deep learning at scale

В четверг мы с вами поболтаем про то как ускорять обучение нейросетей на дохренище видеокарт. В меню - общие подходы, современные алгоритмы, тонкости allreduce и две совершенно безумных статьи которые нужно слушать под чай или что покрепче.

А если досидите до конца, вы узнаете один из самых красивых и простых распределённых алгоритмов, на котором построены торренты и добрая половина распределённых систем :)

Подключайтесь, будет интересно!

И, пожалуйста, зарегистрируйтесь по ссылке.
Мы вас все-равно пустим, и вам все-равно рады, просто интересно 😌
https://docs.google.com/forms/d/e/1FAIpQLSd18PGkZuOqkWThJhmNxnmiSVFicnH4YwLVTCOkEkVQV6ZIDg/viewform

ПС
Вопросы во время трансляции предлагается задавать через микрофон или чат Zoom.
Чтобы не возникало лишнего побочного шума и неразберихи, огромная просьба следить за тем, что ваш микрофон выключен во время трансляции, если вы в данный момент не задаете вопрос :)
источник

SS

Sergey Slotin in RL reading group
@JustHeuristic а про что конкретно расскажешь? О чём будут две безумные статьи?
источник