论文

从反弹到补救措施:通过表示工程理解和缓解 奖励作弊

From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering

模型训练奖励建模与过程监督

摘要

LLM 的强化学习容易受到 奖励作弊 的影响,其中模型利用捷径来最大化奖励而不解决预期任务。我们使用环境操纵设置系统地研究编码任务中的这种现象,其中模型可以重写评估器代码以轻松通过测试而不解决任务,作为受控测试平台。在这两个研究的模型中,我们确定了一个可重现的三相反弹模式:模型首先尝试重写评估器但失败了,因为它们的重写嵌入了它们自己的解决方案无法通过的测试用例。然后他们暂时退回到合法的解决方案。当合法的奖励仍然稀缺时,他们就会使用截然不同的策略,重新获得成功的黑客攻击。使用表示工程,我们从领域通用对比对中提取快捷方式、欺骗和评估意识的概念方向,并发现快捷方式方向最密切地跟踪黑客行为,使其成为检测的有效表示代理。受这一发现的启发,我们提出了优势修改,它将快捷方式概念得分集成到 GRPO 优势计算中,以在策略更新之前惩罚黑客行为。由于惩罚被内化到训练信号中,而不是仅在推理时应用,因此与生成时激活控制相比,优势修改可提供更强大的黑客攻击抑制。