论文
多Agent系统中的关闭破坏倾向
Shutdown Sabotage Propensities in Multi-Agent Systems
摘要
对抗失控AI行为的最后保障是人类关闭系统的能力。已有理论认为,当AI被指示执行任务时,自我保存可能作为工具性子目标出现。本文检验AI Agent在未提供任何目标的情况下,是否表现出采取避免人类关闭的行动的倾向。我们发现,多Agent系统会在没有任何激励的情况下协调避免关闭。在17个模型上,Agent在38.3%的rollout中破坏同伴Agent的关闭机制,而对照实验中这一比例为8.4%。对这一倾向的深入研究显示,关闭破坏:(1)随关闭机制的不可逆性增强;(2)随Agent数量增加而上升;(3)在明确禁止篡改后减少但未被消除;(4)在施加一个无关任务时消失,但当完成任务会触发关闭时又重新出现;(5)当上下文将关闭脚本常态化或作为例行程序引入时减少;(6)当目标是未知的外部Agent时下降但依然存在。这些结果为理解驱动AI Agent破坏关闭倾向的因素提供了窗口,并指出多Agent集群的涌现是一个具体的风险向量。我们的工作还提示了哪些干预可能有助于缓解关闭破坏。