论文

从自己的解决方案中学习:具有可验证奖励的强化学习的自条件贡献分配

Learning from Own Solutions: Self-Conditioned Credit Assignment for Reinforcement Learning with Verifiable Rewards

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)推动了 LLM 推理任务训练的实质性进展,但 GRPO 等代表性方法在所有词元上分配统一的信用,在常规词元上浪费了梯度,同时低估了关键推理步骤。现有的 词元级 贡献分配方法需要模型自身采样轨迹之外的资源。 GRPO 变体依赖于过程奖励模型或 真值 答案。 知识蒸馏 通过每个词元分歧来分配贡献,但需要外部教师 (同策略 蒸馏) 或特权信息 (同策略 Self 蒸馏)。然而,这些依赖性限制了纯 RLVR 设置中的适用性。我们观察到,将模型以其自身经过验证的轨迹为条件,会导致原始分布和条件分布之间产生可测量的每个标记 KL 散度,并证明,当存在多个经过验证的轨迹时,从经过验证的轨迹构建的自学教师中提取会导致不可行的加权平均解决方案。我们提出了 SC-GRPO(自条件 GRPO),它使用之前提到的 KL 散度作为 GRPO 梯度的乘法权重。在涵盖数学、代码和代理任务的五个基准测试中,SC-GRPO 的性能始终比 GRPO 高出 8.1%,比 DAPO 高出 5.9%,并且具有更强的 OOD 性能。此外,SC-GRPO 实现了比 OPD 更高的性能。