论文

SERA:最大似然强化学习的规模均衡rollout分配

SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning

模型训练强化学习

摘要

最大似然强化学习 (MaxRL) 的目标是及时记录成功,并在推理任务中表现出强大的性能。然而,在有限的rollout预算下,MaxRL 使用的估计器会根据一个取决于其成功概率和rollout计数的因子来衰减每个提示的似然梯度。在统一的rollout分配下,共同的rollout计数无法补偿依赖于成功的衰减,从而使低成功提示更加强烈地衰减,并扭曲了它们对预期总梯度的相对贡献。我们引入了 SERA(规模均衡rollout分配),它重新分配固定的rollout预算以大致均衡这些有限rollout比例因子。基于我们对有限rollout如何扭曲即时似然梯度的理论分析,我们将分配公式化为固定预算最大-最小问题,推导出其连续松弛的水线解决方案,并引入多重校正以消除由异构rollout计数引起的额外即时权重。实验表明,在受控 ImageNet 设置中,与精确似然梯度的一致性更强,并且在匹配的训练部署预算下,迷宫导航和数学推理方面的多样本解决方案覆盖率优于 MaxRL。