论文
R²OPL:按步骤预期回报结合强化学习与教师蒸馏
Expected Reasoning-Step Return Unifies On-Policy Learning from Rewards and Teachers
摘要
on-policy推理模型可以从任务奖励或教师信号中学习,但这些来源在形式上有所不同,并且可能有利于相互冲突的更新,从而不清楚哪些应该指导给定的推理行动。我们引入了预期推理步骤返回(ERSR),它将语义推理步骤视为宏观动作,并使用蒙特卡罗学生策略rollout来估计学生生成和教师提出的动作在公共返回空间中的预期最终任务奖励,以进行步骤级比较。 ERSR 分析揭示了一种与结果相关的不对称性:在成功的轨迹上,学生的行为比教师替换更有利,而在失败的轨迹上,教师替换更有利。我们进一步表明,学生答案探究收益跟踪学生步骤 ERSR 效用,并区分有益和有害的推理步骤。基于这些发现,我们提出了返回参考的策略学习(R$^2$OPL),它强化了学生对成功轨迹的推理,并提取了失败轨迹上的教师信号,同时使用组成功率进行难度缩放,并使用学生探测增益进行步进级调制。推理基准和师生配置的实验表明,R$^2$OPL 始终优于强基线。 ERSR 训练动态进一步表明,R$^2$OPL 共同利用了奖励端信号和教师端信号的大量效用,而现有的混合体通常在一个分支中留下大量剩余效用。