论文
能力悖论:更聪明的审计者如何让多智能体系统更不安全
The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure
摘要
多智能体系统通过在专门化智能体之间分解任务来扩展大语言模型(LLM),但其分布式决策过程创造了新的攻击面。我们识别出语义劫持(semantic hijacking),一种将有害请求隐藏在领域特定叙事中、通过Worker报告传播给Manager的攻击,无需任何句法级注入原语。在跨12个Manager模型和7种Worker配置的42000次对抗试验中,我们发现一个能力悖论:随着Worker能力增强,系统级平均攻击成功率(ASR)从18.4%升至63.9%,峰值达94.4%。为解释这一效应,我们在两个独立数据集(47807次交互)上进行多层中介分析。分析显示,该悖论由语言确定性驱动:更强的Worker更可能将对抗性叙事解读为合法内容,并以肯定语气传达结论,从而使Manager将这种自信的背书当作执行的正当理由。在较大的Worker-Only设置($n_W$=14)中,确定性中介了74%的效应,在蒙特卡洛和聚类自助法下95%置信区间(CI)均不包含零;较小的Full-MAS设置($n_W$=6)显示出方向一致的间接效应。Worker侧的安全提示无法可靠缓解这一失效。基于中介分析发现,我们提出异构集成验证,将领域能力不对称的Worker配对,使其互补的脆弱性打断从确定性到执行的链条,将ASR从52.8%降至2.0%,对良性任务的影响可忽略。我们的结果表明,将组件升级为更强模型可能主动降低系统安全性,而有效防御需要利用——而非消除——智能体之间的能力不对称。
