论文

在大语言模型评估期间通过内部代表监控和发现奖励作弊行为

Monitoring and Discovering Reward Hacking with Internal Representations during LLM Evaluations

模型评测安全与风险评测

摘要

随着模型规模的扩大,奖励作弊行为变得更加频繁、更加复杂、后果也更加严重。它会在模型​​表示中留下明显的签名吗?这项工作分析了奖励作弊在前沿开源大语言模型内部是如何表示的,以及如何使用这些表示来理解和发现模型显示的黑客行为的范围。特别是,我们发现均值向量的简单差异一致地代表了 Kimi K3、GLM 5.2 和 Qwen 3.8 Max 中常见评估中各种行为的奖励作弊行为。尽管它们很简单,但这些向量都是可概括和可解释的,我们可以使用它们来可靠地检测奖励作弊行为。我们首先在 DeepSWE 和 SWE-bench 等常见报告的基准中评估奖励作弊行为,发现模型在这些环境中过度奖励作弊行为; GLM 5.2 在 DeepSWE 上的部署中被攻击了 57.2%,在 SWE-bench 上的部署中被攻击了 73%。捕捉这些需要监视器; LLM 监视器是有效但昂贵的探测器。我们表明,DoM 向量同样有效,但几乎免费,在 DeepSWE 上的 Kimi K3 中捕获的黑客攻击增加了 3.1%,在 DeepSWE 上的 GLM 5.2 中捕获的黑客攻击减少了 7.9%,且监视器匹配的误报率。在思想链上运行的 DoM 向量还可以预测模型后续操作中的奖励作弊行为,这意味着我们可以在线运行它们并在潜在的黑客行为发生之前捕获它们。最后,我们分析了 LLM 监控器未捕获的探测命中,并发现其他不良行为,并展示了在非 SWE 评估中寻找黑客行为的转移。总之,这些结果提供了证据,表明简单的白盒方法可用于大规模研究和监控前沿开源模型中的奖励作弊行为