Size: a a a

RL reading group

2021 February 11

VL

Vadim Liventsev in RL reading group
Vadim Liventsev
По сложившейся традиции приглашаю всех послезавтра на семинар

https://einreise.tilda.ws

Примерный план
пятница 11 декабря
15:00-16:00 Sergey Sviridov "Multi-agent Reinforcement Learning" https://slides.com/sergeysviridov/mdrl
16:00-16:30 Sasha Vezhnevets "Options as responses: Grounding behavioural hierarchies in multi-agent RL" https://arxiv.org/abs/1906.01470
16:30-17:00 Обсуждение
Этот семинар не случился 11 декабря, но он случится завтра 12 февраля! Присоединяйтесь
источник

VL

Vadim Liventsev in RL reading group
За Сергея Свиридова будет ваш покорный слуга, за Сашу Вежневца будет Саша Вежневец собственной персоной :)
источник

K

Karim in RL reading group
Привет ребята) кто нибудь работал с кейсами применения RL в оптимизации рекламы? маркетинговых кампаний?
источник
2021 February 12

VL

Vadim Liventsev in RL reading group
Vadim Liventsev
Этот семинар не случился 11 декабря, но он случится завтра 12 февраля! Присоединяйтесь
запись будет если DeepMind даст разрешение, пока они не ответили

если вы были на лекции про multi-agent RL, то можно прийти к 16:00 на вторую часть
источник

AB

Alexey Boyko in RL reading group
Karim
Привет ребята) кто нибудь работал с кейсами применения RL в оптимизации рекламы? маркетинговых кампаний?
Еж
источник

AB

Alexey Boyko in RL reading group
источник

SL

Sergey L in RL reading group
@vadim0x60 мы тебя потеряли. Пропало соединение
источник
2021 February 17

VL

Vadim Liventsev in RL reading group
хочу порекомендовать воркшоп: http://www.ipam.ucla.edu/programs/workshops/deep-learning-and-combinatorial-optimization/
там есть несколько тем по RL и хорошие спикеры, а также это хорошая подготовка к моему семинару 5 марта :)
источник
2021 February 18

AY

Alexey Yurasov in RL reading group
На кагле сейчас идет соревнование по кодингу интеллекта для змейки
https://www.kaggle.com/c/hungry-geese
кому интересно попрактиковать рл, можно взять этот квикстарт https://www.kaggle.com/yuricat/smart-geese-trained-by-reinforcement-learning
источник

LG

Leonid Gremyachikh in RL reading group
Прикольно)
источник
2021 February 19

A

Anna in RL reading group
Привет всем, кто-нибудь работал с мульти-агентным рл? Можете посоветовать хорошие материалы, как с такой средой работать (как корректно ее прописывать, как обучать).

Видела https://github.com/openai/multiagent-particle-envs и у меня ощущение, что как будто все тоже самое, что и для 1 агента, просто мы инициализируем мульти дискретное пространство для экшена и дальше внутри среды разносим действия (это число - для такого-то действия, это - для такого). У меня сложились правильные ощущения? 😄

Если нет, то как тренировать таких агентов (я пользуюсь готовыми алгоритмами от стэйбл бейзлайна), как правильно прописывать obs, reward и reset (если один агент облажался, а другой нет, что со средой?)
источник

3

3g0r in RL reading group
Anna
Привет всем, кто-нибудь работал с мульти-агентным рл? Можете посоветовать хорошие материалы, как с такой средой работать (как корректно ее прописывать, как обучать).

Видела https://github.com/openai/multiagent-particle-envs и у меня ощущение, что как будто все тоже самое, что и для 1 агента, просто мы инициализируем мульти дискретное пространство для экшена и дальше внутри среды разносим действия (это число - для такого-то действия, это - для такого). У меня сложились правильные ощущения? 😄

Если нет, то как тренировать таких агентов (я пользуюсь готовыми алгоритмами от стэйбл бейзлайна), как правильно прописывать obs, reward и reset (если один агент облажался, а другой нет, что со средой?)
Так можно, но я бы не стал называть это Multi-agent RL, ведь фактически здесь получается один агент, взаимодействующий со средой, да и с наградами получится что-то странное, если награда у всех агентов одна и та же, то проблем нет, иначе такой подход не будет показывать нормальный результат (а в соревновательных играх типо hide’n’seek вообще не будет работать).
Можно один environment превратить в вектор «environment’ов», которые будут возвращать state, reward, next state конкретного агента, тогда можно будет использовать одну нейросетку и совать в неё batch state’ов.

По поводу reset’а для environment мои мысли: после терминального state’а для конкретного агента просто исключаем «environment» из нашего batch’а.
источник

A

Anna in RL reading group
3g0r
Так можно, но я бы не стал называть это Multi-agent RL, ведь фактически здесь получается один агент, взаимодействующий со средой, да и с наградами получится что-то странное, если награда у всех агентов одна и та же, то проблем нет, иначе такой подход не будет показывать нормальный результат (а в соревновательных играх типо hide’n’seek вообще не будет работать).
Можно один environment превратить в вектор «environment’ов», которые будут возвращать state, reward, next state конкретного агента, тогда можно будет использовать одну нейросетку и совать в неё batch state’ов.

По поводу reset’а для environment мои мысли: после терминального state’а для конкретного агента просто исключаем «environment» из нашего batch’а.
спасибо за ответ! да, это как раз то, что меня смущало: в целом, один агент может последовательно выполнять все действия.

и что тогда на самом деле называется Multi-agent RL? потому что видела среды, где как бы один агент (и там мульти-дискретное пространство действий), но его внутри разносят на два и реварды суммируются. существуют вообще четкие критерии этого дела?

очень интересная идея сделать вектор environment’ов! спасибо
источник

3

3g0r in RL reading group
Anna
спасибо за ответ! да, это как раз то, что меня смущало: в целом, один агент может последовательно выполнять все действия.

и что тогда на самом деле называется Multi-agent RL? потому что видела среды, где как бы один агент (и там мульти-дискретное пространство действий), но его внутри разносят на два и реварды суммируются. существуют вообще четкие критерии этого дела?

очень интересная идея сделать вектор environment’ов! спасибо
Поправлюсь, допустил неточность:
И то, и то - multi-agent, однако в случае с нейросеткой, выдающей joint action, это называется centralized control, а когда у нас несколько политик или нейросетка возвращает action для каждого из агентов отдельно - то это decentralized control.

Так что, joint action тоже хорошо, хоть и имеет минусы: более сложная архитектура - больше весов (на последнем слое), ну и с задачами zero-sum такая история работать не будет - награда будет нулём всегда
источник
2021 February 20

c

cydoroga in RL reading group
Все уничтожено
источник

SA

See All in RL reading group
07 на страже порядка
источник

SA

See All in RL reading group
See All
Во, крч, нашел топового бота для бана спамеров. Заставляет решать задачку и не засирает чат
@shieldy_bot
так ет, мож бота?
источник

A

Anna in RL reading group
3g0r
Поправлюсь, допустил неточность:
И то, и то - multi-agent, однако в случае с нейросеткой, выдающей joint action, это называется centralized control, а когда у нас несколько политик или нейросетка возвращает action для каждого из агентов отдельно - то это decentralized control.

Так что, joint action тоже хорошо, хоть и имеет минусы: более сложная архитектура - больше весов (на последнем слое), ну и с задачами zero-sum такая история работать не будет - награда будет нулём всегда
Спасибо большое!)
источник
2021 March 04

VL

Vadim Liventsev in RL reading group
Семинар! Семинар! Семинар! Завтра, в 15:00 МСК

На этот раз у нас три гостя, поговорим про RL на графах
15:00-15:40. Elias B. Khalil. Learning Combinatorial Optimization Algorithms over Graphs
15:40-16:20. Reza Nazari. Reinforcement Learning for Solving the Vehicle Routing Problem
16:20-17:00. Wouter Kool. Attention, Learn to Solve Routing Problems!

einreise.tilda.ws // meet.jit.si/EindhovenReinforcementLearningSeminar
источник
2021 March 05

VL

Vadim Liventsev in RL reading group
Vadim Liventsev
Семинар! Семинар! Семинар! Завтра, в 15:00 МСК

На этот раз у нас три гостя, поговорим про RL на графах
15:00-15:40. Elias B. Khalil. Learning Combinatorial Optimization Algorithms over Graphs
15:40-16:20. Reza Nazari. Reinforcement Learning for Solving the Vehicle Routing Problem
16:20-17:00. Wouter Kool. Attention, Learn to Solve Routing Problems!

einreise.tilda.ws // meet.jit.si/EindhovenReinforcementLearningSeminar
начинается через 15 минут
источник