论文

从失败中学习:以纠正为导向的政策优化与可验证的奖励

Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

模型训练强化学习

摘要

带可验证奖励的强化学习(RLVR)已成为提高 大语言模型 推理能力的有效范例。然而,RLVR 训练常常受到稀疏的二元奖励和薄弱的贡献分配的阻碍,导致优化信号不明确,并且未能充分利用失败轨迹中嵌入的有用信息。为了应对这一挑战,我们提出了面向校正的策略优化(CIPO),这是 RLVR 的简单有效的扩展,可将 同策略 失败的轨迹转换为面向校正的监督,而不依赖于任何外部信号。通过联合优化从模型自身失败尝试中得出的校正样本以及标准 RLVR 目标,CIPO 提高了学习效率,同时显着增强了模型校正自身错误的能力。涵盖数学推理和代码生成的 11 个基准的广泛实验表明,CIPO 在推理和校正性能方面始终显着优于强大的基准。此外,CIPO 产生了更强的 pass@K 增益,表明它提高了模型的内在推理能力,而不仅仅是在现有正确答案上重新分配概率质量。