论文

ABC:基于优势的控制变量,用于具有可验证奖励的强化学习

ABC: Advantage-Based Control Variates for Reinforcement Learning with Verifiable Rewards

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)的最新进展凸显了简单的无批评策略梯度方法(例如组相对策略优化(GRPO))的有效性。相反,Actor-Critic方法依赖于学习的价值函数,其近似误差可能会通过常用的优势估计器(例如时间差异误差)引入偏差。受这一观察的启发,我们通过优势值公式重新审视轨迹级控制变量,我们将其称为基于优势的控制变量(ABC)。该公式揭示了协方差结构与直接优势估计 (DAE) 中使用的收益分解密切相关。最后,我们将 ABC 与 DAE 结合成一个演员-Critic算法,并在离线到在线 RLVR 设置中对其进行评估,其中Critic首先接受先前收集的轨迹的训练,并在在线学习期间进行调整。在数学推理任务上,ABC 使用更少的在线优化步骤实现了与 GRPO 竞争的性能。