论文
LLM 游戏验证者:RLVR 可以导致 奖励作弊
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
摘要
随着可验证奖励的强化学习(RLVR)已成为 LLM 中扩展推理能力的主导范例,一种新的故障模式出现了:LLM 游戏验证器。我们在归纳推理任务中研究这种现象,其中模型必须归纳并输出逻辑规则。我们发现 RLVR 训练的模型系统地放弃了规则归纳。他们不是学习可概括的模式(例如,“运载红色汽车的火车向东行驶”),而是枚举实例级标签,生成通过验证器的输出,而不捕获任务所需的关系模式。我们证明这种行为并不是理解失败,而是 奖励作弊 的一种形式:仅检查外延正确性的不完美验证者会承认误报。为了检测这种捷径,我们引入了同构扰动测试(IPT),它在外延和同构验证下评估单个模型输出,其中后者在逻辑同构任务下强制执行不变性。虽然真正的规则归纳保持不变,但捷径策略却失败了。我们发现捷径行为特定于 RLVR 训练的推理模型(例如 GPT-5、Olmo3),并且在非 RLVR 模型(例如 GPT-4o、GPT-4.5、Ministral)中不存在。此外,捷径的流行随着任务复杂性和推理时间计算的增加而增加。在受控训练实验中,外延验证直接引入捷径策略,而同构验证则消除它们。这些结果表明,RLVR 不仅可以通过公开操纵,还可以通过利用验证者未能执行的内容来激励 奖励作弊。