论文

LLM 推理的逐步奖励

Step-wise Rubric Rewards for LLM Reasoning

模型训练奖励建模与过程监督

摘要

带可验证奖励的强化学习(RLVR)广泛用于改进 大语言模型 中的推理,但仅奖励最终答案的正确性,而不对中间步骤进行监督。基于Rubric的方法,例如Rubrics as Rewards (RaR),通过根据结构化标准对采样轨迹进行评分,引入了更细粒度的监督,但Rubric分数仍然聚合为应用于整个响应的单个标量,从而导致三个弱点:多标准结构的丢失、正确和错误步骤的统一监督以及通过无界自我纠正的奖励作弊。在 1,000 个问题中,我们发现正确答案中 18.2% 的步骤是错误的,但会受到积极奖励,而错误答案中 49.9% 的步骤是正确的,但会受到惩罚。我们引入了逐步评分标准作为奖励(SRaR),这是一个 RLVR 框架,它(i)使用 LLM 判断将每个评分项目归因于特定的推理步骤,(ii)在采样轨迹过程中标准化每步评分标准,以便只有质量不同的步骤才会产生学习信号,以及(iii)通过一个保持结果基线稳定的解耦优势估计器将每步奖励与结果奖励结合起来。我们通过从强模型中采样的正确和有缺陷的推理路径中对比提取标题项,进一步构建了 16K 问题标题数据集。在六个数学推理基准测试中,SRaR 在 Qwen3-8B 上比 RaR 平均准确度提高了 3.57 点,在 Qwen3-32B 上提高了 2.75 点,将 AIME 2025 上的忠实推理率从 34.5% 提高到 46.7%,并将自校正循环从 48.1% 减少到 26.5%。