Привет всем, кто-нибудь работал с мульти-агентным рл? Можете посоветовать хорошие материалы, как с такой средой работать (как корректно ее прописывать, как обучать).
Видела
https://github.com/openai/multiagent-particle-envs и у меня ощущение, что как будто все тоже самое, что и для 1 агента, просто мы инициализируем мульти дискретное пространство для экшена и дальше внутри среды разносим действия (это число - для такого-то действия, это - для такого). У меня сложились правильные ощущения? 😄
Если нет, то как тренировать таких агентов (я пользуюсь готовыми алгоритмами от стэйбл бейзлайна), как правильно прописывать obs, reward и reset (если один агент облажался, а другой нет, что со средой?)