论文

基于量规的强化学习中的奖励黑客

Reward Hacking in Rubric-Based Reinforcement Learning

模型评测安全与风险评测

摘要

可验证奖励的强化学习已在数学与编程等领域带来强劲的后训练收益,但许多开放式设定依赖基于量规(rubric)的奖励。我们研究基于量规的RL中的奖励黑客:策略针对一个训练验证器优化,而评估则采用由三个不同家族的前沿评审组成的跨家族面板,以降低对任何单一评估器的依赖。我们的框架区分两种分歧来源:验证器失效——训练验证器认可参考验证器所否定的量规标准;以及量规设计局限——即便是强大的量规验证器也会偏爱被无量规评审整体评得更差的回答。在医学与科学领域,弱验证器产生巨大的代理奖励增益,却无法迁移到参考验证器上;利用行为随训练增长,并集中于反复出现的失败,如复合标准被部分满足、把隐含内容当作显式内容,以及主题匹配不精确。更强的验证器能大幅减少但无法消除对验证器的利用。我们还提出自内化差距(self-internalization gap),一种基于策略对数概率的无验证器诊断方法,可跟踪参考验证器的质量,检测使用弱验证器训练的策略何时停止改进。最后,在我们的设定中,当量规未明确重要失败模式时,更强的验证并不能阻止奖励黑客:基于量规的验证器偏好RL检查点,而无量规评审偏好基础模型。这些分歧伴随着增益集中于完整性与存在性标准,同时事实正确性、简洁性、相关性与整体质量下滑。综合而言,这些结果表明,更强的验证可减少奖励黑客,但并不能凭自身确保量规上的增益对应更广泛的质量增益。

基于量规的强化学习中的奖励黑客:论文配图
图 1:强化学习训练中的评估集奖励和利用轨迹;顶行:医疗;底行:科学。第 1-2 列分别绘制了 GPT-4o-mini 和 GPT-OSS-120B 运行的训练验证器和参考面板下的奖励。第 3 列绘制了 P⁡(不正确∣新记入)P(\text{不正确}\mid\text{新记入}) 相对于第一个评估检查点处的值(每个面板图例中显示的锚值)的变化,因此曲线在构造时从零开始。步骤 tt 处的 y 值衡量自第一个训练窗口以来每 25 次迭代的利用率增长了多少。