DN
Size: a a a
SI
DN
B
P(s, a) перед UCB? Почему он должен быть пропорционален вероятности действия a?) не очень понятны, P(s, a) — это же стратегия. По вопросу 3 и 4 (Почему знаменатель не под корнем? Что за +1 в знаменателе?), вероятно, что-то можно прояснить из статьи Rosin, C. D. (2011). Multi-armed bandits with episode context, там излагается алгоритм, вариацией которого является предложенный в AlphaGO Zero (формула 2). Там довольно громоздкие выкладки и нотация не совпадает с общепринятой в RL. Я бы предположил, что +1 нужен на случай, если N(s, a) равен 0, а корень отсутствует, чтобы повысить предпочтение неисследованных действий. Насчет коэффициента MuZero — хз)))c
B
c
B

AK
c
B

c
B
B
AK
c
B