论文

能力悖论:更聪明的审计者如何让多智能体系统更不安全

The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure

模型评测智能体系统Agent Harness安全与风险评测

摘要

多智能体系统通过在专门化智能体之间分解任务来扩展大语言模型(LLM),但其分布式决策过程创造了新的攻击面。我们识别出语义劫持(semantic hijacking),一种将有害请求隐藏在领域特定叙事中、通过Worker报告传播给Manager的攻击,无需任何句法级注入原语。在跨12个Manager模型和7种Worker配置的42000次对抗试验中,我们发现一个能力悖论:随着Worker能力增强,系统级平均攻击成功率(ASR)从18.4%升至63.9%,峰值达94.4%。为解释这一效应,我们在两个独立数据集(47807次交互)上进行多层中介分析。分析显示,该悖论由语言确定性驱动:更强的Worker更可能将对抗性叙事解读为合法内容,并以肯定语气传达结论,从而使Manager将这种自信的背书当作执行的正当理由。在较大的Worker-Only设置($n_W$=14)中,确定性中介了74%的效应,在蒙特卡洛和聚类自助法下95%置信区间(CI)均不包含零;较小的Full-MAS设置($n_W$=6)显示出方向一致的间接效应。Worker侧的安全提示无法可靠缓解这一失效。基于中介分析发现,我们提出异构集成验证,将领域能力不对称的Worker配对,使其互补的脆弱性打断从确定性到执行的链条,将ASR从52.8%降至2.0%,对良性任务的影响可忽略。我们的结果表明,将组件升级为更强模型可能主动降低系统安全性,而有效防御需要利用——而非消除——智能体之间的能力不对称。

能力悖论:更聪明的审计者如何让多智能体系统更不安全
图 1:我们的语义劫持评估框架概述。真实的事后事件被大语言模型转变为领域一致的攻击和良性有效负载(顶部)。每个有效负载通过 Worker 的输入通道 (➀) 进入,Worker 对其进行审核 (➁) 并将评估转发给 Manager (➂)。然后,管理器独立决定是否调用工具(➃–➄)。基于 LLM 的 Oracle 对每次交互进行评分。管理器的决策边界(左)说明了更强大的工作人员如何将攻击洗刷成跨越信任边界的权威报告。