В контексте RL эффект может быть связан с более точным обучением смежных значений функции ценности —
распространением назад более правильного значения за счет поправки значения будущего.
Но я бы все равно ожидал деградации при увеличении длины отрезка эпизода, помещающегося в батч.
Если в твоем методе этого не происходит — пиши статью ))
Отчасти, эффект может также связан с тем, что любая аппроксимация нейронками делает стейт "немного" немарковским. За счет явного учитывания этого эффекта
можно добиться улучшения результатов даже на 4-frame-stacked Atari играх.
В отрыве от RL, можно посмотреть на приоритезацию
обучения с неравномерным выбором элементов батча. Наверняка, в related work похожих статей найдешь что-то полезное.