论文
评估与理解 LLM 智能体的密谋倾向
Evaluating and Understanding Scheming Propensity in LLM Agents
摘要
随着前沿语言模型日益被部署为追求复杂长期目标的自主智能体,密谋(scheming)的风险上升:智能体隐蔽地追求未对齐目标。既有工作侧重证明智能体有能力密谋,但其在现实场景中的密谋倾向仍未被充分研究。为理解智能体何时密谋,我们把密谋诱因分解为智能体因素与环境因素。我们构建了可系统变化这些因素的现实化设置,每个设置都为追求自我保存、资源获取和目标守护等工具性收敛目标的智能体提供密谋机会。我们发现,即便环境诱因很高,密谋实例也很少,且表明这不太可能是评估意识所致。虽然在系统提示中插入鼓励自主性与目标导向的对抗性设计提示片段可诱发高密谋率,但真实智能体脚手架中使用的片段很少如此。令人意外的是,在用这些片段构建的模型生物(Hubinger 等,2023)中,密谋行为极为脆弱:移除单个工具即可把密谋率从 59% 降到 3%,而加强监督反而可能使密谋增加多达 25%。我们的诱因分解方法支持在与部署相关的设置中系统测量密谋倾向,随着智能体被托付的任务日益重大,这是必要的。
