论文
使用梯度指纹检测和抑制 奖励作弊
Detecting and Suppressing Reward Hacking with Gradient Fingerprints
摘要
具有可验证奖励的强化学习(RLVR)通常会优化结果奖励,而不会对中间推理施加限制。这使得训练容易受到 奖励作弊 的影响,其中模型利用奖励函数中的漏洞(例如训练数据中的虚假模式)来获得高分,而不解决预期的任务。这些 奖励作弊 行为通常是隐含的,因为中间思想链 (CoT) 可能在表面上看起来似乎合理,从而限制了纯粹基于文本的监控的有效性。我们提出了梯度指纹(GRIFT),这是一种使用模型内部计算来检测 奖励作弊 的方法。给定提示和模型生成的 CoT,GRIFT 计算以提示为条件的 CoT 梯度,并将其压缩为紧凑表示,然后用于评估 CoT 是否反映 奖励作弊 行为。在涵盖数学、代码和逻辑推理的可验证推理基准中,GRIFT 的性能远远优于强大的基准,包括 CoT Monitor 和 TRACE,在检测 奖励作弊 行为方面实现了超过 25% 的相对改进。此外,将 GRIFT 集成到推理任务的拒绝 微调 管道中可以减少 奖励作弊 并提高真实任务目标的性能。我们的结果凸显了利用梯度水平表示来评估 CoT 推理轨迹质量的一个有前途的方向。我们的代码位于:https://github.com/songtao-x/reward_hack。