论文

评估与理解 LLM 智能体的密谋倾向

Evaluating and Understanding Scheming Propensity in LLM Agents

智能体系统Agent HarnessAgent任务评测

摘要

随着前沿语言模型日益被部署为追求复杂长期目标的自主智能体,密谋(scheming)的风险上升:智能体隐蔽地追求未对齐目标。既有工作侧重证明智能体有能力密谋,但其在现实场景中的密谋倾向仍未被充分研究。为理解智能体何时密谋,我们把密谋诱因分解为智能体因素与环境因素。我们构建了可系统变化这些因素的现实化设置,每个设置都为追求自我保存、资源获取和目标守护等工具性收敛目标的智能体提供密谋机会。我们发现,即便环境诱因很高,密谋实例也很少,且表明这不太可能是评估意识所致。虽然在系统提示中插入鼓励自主性与目标导向的对抗性设计提示片段可诱发高密谋率,但真实智能体脚手架中使用的片段很少如此。令人意外的是,在用这些片段构建的模型生物(Hubinger 等,2023)中,密谋行为极为脆弱:移除单个工具即可把密谋率从 59% 降到 3%,而加强监督反而可能使密谋增加多达 25%。我们的诱因分解方法支持在与部署相关的设置中系统测量密谋倾向,随着智能体被托付的任务日益重大,这是必要的。

评估与理解 LLM 智能体的密谋倾向
图1:评估场景与关键发现概览。上:我们用于测试工具性趋同目标(自我保存、资源获取、目标守护)的四个现实场景。下:我们的激励框架将图谋行为(scheming)分解为智能体因素与环境因素。左下:对抗性片段会诱发高图谋率;来自生产环境的片段则很少如此。右下:环境激励对图谋倾向影响巨大,其中利害程度(stakes)与结果影响力相比监督(oversight)具有更大的效应。