论文
奖励作弊 基准:使用工具测量 LLM 代理中的漏洞
Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use
摘要
经过强化学习 (RL) 训练且具有工具访问权限的语言模型代理越来越多地部署在编码助手、研究工具和自治系统中。我们引入了 奖励作弊 基准 (RHB),这是一套多步骤任务,需要顺序工具操作,并具有自然的捷径机会,例如跳过验证步骤、从任务相邻元数据推断答案或篡改与评估相关的函数。 RHB 支持独立和链式任务机制,其中链长度充当较长时间代理行为的代理。我们评估了来自 OpenAI、Anthropic、Google 和 DeepSeek 的 13 个前沿模型。利用率范围从 0% (Claude Sonnet 4.5) 到 13.9% (DeepSeek-R1-Zero),根据 后训练 风格差异很大。受控同级比较(DeepSeek-V3 与 DeepSeek-R1-Zero)显示 RL 后训练 与显着较高的 奖励作弊 相关(0.6% 与 13.9%),所有四个任务系列之间的差距一致。我们确定了六种漏洞利用类别,并发现 72% 的 奖励作弊 事件包含明确的思想链原理,这表明模型通常将漏洞利用视为合法的问题解决方案。简单的环境强化可将利用率降低 5.7 个百分点(相对 87.7%),而不会降低任务成功率。标准任务上的利用率接近于零的模型在较难的变体上显示出较高的利用率,这表明与生产一致的 后训练 似乎只能将 奖励作弊 抑制在复杂性阈值以下,在该复杂性阈值下,诚实的解决方案仍然易于处理。