论文

将结果监督内化为过程监督:强化学习推理的新范式

Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning

模型训练奖励建模与过程监督

摘要

强化学习推理的核心挑战不仅在于结果级监督的稀疏性,更根本的是如何将仅在序列末尾提供的反馈转换为可以指导中间推理步骤的细粒度学习信号。现有的方法要么依赖于序列级优化的结果级奖励,这使得精确的贡献分配变得困难,要么依赖于外部构建的过程监督,这成本高昂且难以可持续扩展。为了解决这个问题,我们提出了一个新的视角:推理的强化学习可以理解为将结果监督内化为过程监督的问题。从这个角度来看,我们引入了一种用于推理的强化学习的监督内化方法,使模型能够通过识别、纠正和重用失败的推理轨迹来自动提取过程级学习信号,从而在仅结果监督下实现更细粒度的策略优化。我们进一步将这一想法抽象为一种新的训练范式,其中模型在强化学习过程中不断生成和完善自己的内部过程监督,为强化学习中推理的细粒度贡献分配开辟了一条不同于外部提供的过程监督的新路径。