论文
Cliff:从第一个错误中获得的学习过程奖励
Cliff: Learning Process Rewards from the First Mistake
摘要
具有可验证奖励的强化学习(RLVR)已成为 大语言模型(LLM)后训练 的强大范例,但其对粗略结果奖励的依赖导致对中间推理过程的指导有限。过程奖励建模和 同策略 蒸馏 等现有方法引入了额外的约束,例如依赖专门的奖励模型或假设教师和学生之间具有相同的推理模式。然而,我们观察到,一旦推理过程首先出错,评估后续推理提供的附加信息有限,因为它已经以无效前缀为条件。因此,我们提出了 Cliff,一种奖励塑造策略,利用现成的 LLM 作为老师来识别每条采样轨迹中的第一个错误。结果,采样轨迹自然地分解为两部分:正确的前缀和不正确的后缀。然后 Cliff 将此信号转换为 词元级 优势,为正确的前缀分配正优势,然后分配负反馈。 12 个不同场景的实验表明,即使教师能力一般,Cliff 也能持续提高推理性能,比 同策略 蒸馏 提高 15%,比标准 GRPO 提高 7%。此外,我们分析了“真值”在 Cliff 中的作用并研究了其训练动态。这些结果表明 Cliff 是一种简单、通用且有效的方法,可以通过更丰富、更细粒度的监督来改进 RLVR。