论文
LLM 推理与结果引导步骤的过程奖励
LLM Reasoning with Process Rewards for Outcome-Guided Steps
摘要
通过使用可验证奖励的强化学习,大语言模型 中的数学推理得到了显着改善,最终答案可以自动检查并转换为可靠的训练信号。大多数此类管道仅优化结果的正确性,这会为长的多步骤解决方案产生稀疏的反馈,并对中间推理错误提供有限的指导。因此,最近的工作引入了过程奖励模型(PRM)来对中间步骤进行评分并提供更密集的监督。在实践中,PRM 分数通常与最终正确性不完全一致,并且可以奖励仍然以错误答案结束的局部流畅推理。当作为绝对奖励进行优化时,此类信号可以放大流畅的故障模式并引发 奖励作弊。我们提出了 PROGRS,这是一个利用 PRM 的框架,同时保持结果正确性占主导地位。 PROGRS 将过程奖励视为结果组内的相对偏好,而不是绝对目标。我们引入了以结果为条件的中心化,它将不正确轨迹的 PRM 分数转移到每个提示组内的均值为零。它消除了系统偏差,同时保留了信息丰富的排名。 PROGRS 将冻结分位数回归 PRM 与多尺度一致性评估器相结合。我们将由此产生的集中过程奖励集成到组相对策略优化(GRPO)中,无需辅助目标或额外的可训练组件。在 MATH-500、AMC、AIME、MinervaMath 和 OlympiadBench 中,PROGRS 持续改进 Pass@1 超过仅结果基线,并以更少的采样轨迹实现更强的性能。这些结果表明,以结果为条件的中心可以安全有效地使用过程奖励进行数学推理。