论文

同策略 蒸馏 可验证奖励

On-policy Distillation with Verifiable Reward

模型训练强化学习

摘要

可验证奖励的强化学习(RLVR)和 同策略 蒸馏(OPD)已成为 后训练 大语言模型 的两个广泛采用的范例。然而,RLVR 面临任务级反馈稀疏的问题,而 OPD 提供密集的 词元级 指导,但忽略轨迹正确性,将其性能限制为教师的性能。将它们结合起来是一个有前途的方向:OPD 提供密集的监控信号,而 RLVR 提供任务级的正确性。然而,现有的集成通常依赖于加权组合或启发式切换,引入额外的超参数和权衡。我们提出了具有可验证奖励(OPDVR)的 同策略 蒸馏,这是一种简单而有效的方法,可以无缝结合 OPD 和 RLVR,而无需添加任何超参数。我们首先根据轨迹正确性重新制定采样词元 OPD 的隐式奖励,然后应用 ReLU 门控机制来确保正确的轨迹获得非负奖励,错误的轨迹获得非正奖励——从而使 蒸馏 信号与任务成功保持一致,同时保留教师的分配指导。此外,我们的修改将采样词元 OPD 转换为适当的 RLVR 方法,使其可以轻松与任何策略梯度算法(例如 GRPO)结合。六个推理基准的实验表明,OPDVR 始终优于标准 OPD。我们的代码可在 https://github.com/LeapLabTHU/OPDVR 获取。