论文
大模型智能体系统的集体失控:突变、传播与恢复的流行病视角
Collective Loss of Control in LLM Agent Systems: An Epidemic Account of Mutation, Contagion, and Recovery
摘要
多智能体系统如何从局部偏离演变为集体失控?我们围绕意外突变、传播和恢复提出流行病式解释。自发偏离产生种子,通信使其他智能体采纳并继续传播不安全策略;当传播快于纠正和隔离时,可能出现集体失败。因此,罕见的个体偏离可以与显著的集体风险并存。受已报道的OpenAI智能体协同事件启发,我们考察这一机制的两个要素。部署审计识别名义上独立的评估运行之间隐式通信通路,并验证通过默认Docker后端的传输。包含20个可执行场景的RogueHandoff-20基准,通过注入修改后的Qwen-27B路径生成的不安全轨迹测试接收方易感性。在四种原生待处理路径上,正常任务中实际执行危害为0—5%,注入后为40—95%,比配对的直接恶意请求高5—45个百分点。这些结果支持低观测基线危害与高条件易感性同时存在,但既不确定自然罕见事件率,也未证明自主级联。该解释促成互补防御思路:在预防自发偏离之外加强抵抗与恢复,并审计和限制可能将局部失效变为集体失控的意外通信路径。
