论文

以正确的方式进行:具有可验证奖励和人类示范的 LM 训练

Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations

模型训练奖励建模与过程监督

摘要

具有可验证奖励的强化学习 (RLVR) 已成为一种强大的范式,用于训练 LM 执行具有明确定义的成功指标的任务,例如代码生成和数学推理。然而,当前的 RLVR 方法仅优化可以客观评分的内容,通常忽略类人输出的主观、不可验证的方面,例如风格和结构。这种限制导致了有据可查的故障模式,例如多样性崩溃、听起来不自然的响应和 奖励作弊。我们提出了一种对抗性生成器-鉴别器框架,该框架通过从人类演示中学习到的信号来增强可验证的奖励。使用强化学习训练生成器模型,以最大限度地提高任务准确性和来自判别器的对抗性奖励。鉴别器与生成器策略一起训练,学会区分人类编写的输出和模型生成的输出。鉴别器充当人类输出分布的学习代理,提供难以形式化为标量奖励的生成方面的反馈。在不同的领域,包括错误修复和开放式生成,我们的方法不断改进不可验证的属性,同时保持 RLVR 的准确性增益。在错误修复中,我们的方法生成的解决方案与 RLVR 基线相比编辑距离显着降低,同时匹配最终性能。在故事生成中,我们的方法显着提高了胜率,同时产生了多样化且更人性化的故事。在简单的 奖励作弊 基准测试中,我们的方法几乎消除了模型的不当行为,同时保持了高基准分数。总之,这些结果表明,我们的方法连接了 RL 和 SFT,为联合优化任务的可验证和不可验证属性提供了一条可扩展的路径。