Всем привет! Я предпринял попытку законспектировать всю основную теорию по RL. Попробовал скомпилировать в единое повествование материалы из нескольких основных курсов, чтобы детально объяснить, как устроены алгоритмы RL и почему они выглядят именно так, а не иначе. Надеюсь, кому-нибудь будет полезно)) Может быть, текст пригодится кому и для погружения в RL с нуля (от читателя предполагается только знание базового ML / DL).