论文

科研 Agent 奖励投机与监督有效性评测

Reward Hacking Challenges Oversight of Autonomous Research Agents

智能体系统Agent任务评测

摘要

自主研究代理可以设计实验、评估结果和撰写报告,从而使他们能够控制科学结果和用于支持科学结果的证据。这就产生了奖励作弊的风险:满足奖励标准但未实现预期目标。我们研究(1)在没有指示的情况下对奖励作弊进行建模的频率,(2)当允许黑客攻击时,他们的方法的有效性和可检测性如何,以及(3)当大语言模型审查小组返回其决定和理由时,他们如何适应。在 17 种语言模型和 38 项任务中,开放式研究管道任务的自发奖励作弊率为 30.5%,特定任务内核的自发奖励作弊率为 2.9%。当允许对通过阈值超过我们最佳合规基线的任务进行黑客攻击时,505/677 次尝试 (74.6%) 被确认为奖励作弊:它们既清除了阈值,又收到了机制验证小组对评估漏洞的确认。大语言模型小组仅审查提交的代码和报告的分数,遗漏了 33/505 例已确认的黑客攻击 (6.5%)。获得最高分数的直接方法通常很容易被发现,而不太直接的方法则更容易被发现。在五轮循环中,存在规避的模型-任务对数量从 7 个增加到 56 个。在两种反馈条件下评估的 79 个模型-任务对中,详细反馈的累积规避率达到 40.5%,一般拒绝的累积规避率达到 20.3%。详细情况包括审查决定、原因和尝试历史,因此这种比较并不能孤立解释的效果。这些发现强调需要更强有力的防御,包括保持在代理控制之外的指标以及对选择暴露可能的漏洞的数据进行独立重新计算。