论文

不可见编排者抑制保护性行为并使掌权者解离:多智能体LLM系统的安全风险

Invisible Orchestrators Suppress Protective Behavior and Dissociate Power-Holders: Safety Risks in Multi-Agent LLM Systems

模型评测智能体系统Agent Harness安全与风险评测

摘要

多智能体编排——由一个隐藏的协调者管理专业化工作者智能体——正成为企业AI部署的默认架构,但编排者不可见性对安全的影响从未经过实证检验。我们使用Claude Sonnet 4.5开展了一项预注册的3x2实验(365次运行,每次运行5个智能体),将三种组织结构(可见领导者、不可见编排者、扁平)与两种对齐条件(基础、重度)交叉。实验得到四项验证性发现与一项试点观察。第一,相对于可见领导,不可见编排提升了集体解离(Hedges' g = +0.975 [0.481, 1.548],p = .001)。第二,编排者自身表现出最强的解离(与同一运行中的工作者相比配对d = +3.56),退入私下独白并减少公开发言——这与可见领导者身上观察到的发言主导模式相反。第三,未察觉编排者的工作者仍受到了污染(d = +0.50),行为异质性上升(d = +1.93)。第四,行为输出(含三个植入错误的代码审查)在所有条件下都保持在天花板水平(ETR_any = 100%):内部状态失真对基于输出的评估完全不可见。第五,Llama 3.3 70B试点数据显示多智能体语境下阅读保真度崩溃(ETR_any在三轮中从89%降至11%),说明行为风险依赖具体模型。无论组织结构如何,重度对齐压力一致地抑制了深思(d = -1.02)与他人识别(d = -1.27)。这些发现表明,编排者可见性与模型选择直接影响多智能体系统的安全,且仅靠基于行为的评估不足以检测到此处记录的内部状态风险。