Всё вписывается, нет? Action - выбор ручки, State - состояние автомата с конкретно выбранной ручкой, Reward - следствие состояния.
Да, вырожденный случай: (1) reward после каждого действия (2) action легко и однозначно отображается в полученный state, но разве оттого схема ломается? Ну просто environment простой получается.