论文

Soft-SVeRL:具有软奖励的自我验证强化学习

Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

模型训练强化学习

摘要

可验证奖励的强化学习(RLVR)改进了数学和代码等领域的语言模型,可以自动检查正确性。然而,许多重要任务只能部分验证:提示包含多个要求,响应可能满足部分要求但不能满足全部要求,或者可能不存在单一参考答案。我们引入了 Soft-RLVR,这是一种根据分解的、学习的验证信号进行强化学习的框架。 Soft-RLVR 将每个提示转换为原子要求清单,使用 LLM 验证器逐项对候选响应进行评分,并根据生成的软奖励进行训练。基于清单的奖励将稀疏的通过/失败监督转变为更密集的部分信用信号,但它们也引入了一个权衡:平均项目级判断可以减少验证者的噪音,而部分信用可以奖励不完整的响应。我们将这种权衡形式化,并确定基于检查表的验证比整体验证提供更可靠的 RL 训练信号的条件。我们进一步介绍 Soft-SVeRL,这是 Soft-RLVR 的一种自我验证变体,其中策略也充当验证者。我们表明,自我验证很容易因过于宽容的自我判断而导致通货膨胀,并且需要明确的稳定来防止这种崩溃。在具有基于规则的 真值 评估的受控指令遵循设置中,基于清单的 Soft-RLVR 仅使用学习到的验证者奖励将 IFEval 提高了 11.1 点。我们的实验进一步表明,验证者质量和检查表质量都会影响下游 RL 结果,并且明确的稳定性对于有效的自我验证至关重要。