论文

OMNI-LEAK:编排器多智能体网络引发的数据泄露

OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage

模型评测智能体系统Agent Harness安全与风险评测

摘要

随着大语言模型(LLM)智能体能力不断增强,以多智能体系统的形式协同使用它们预计将成为一种实用范式。已有工作考察了与智能体相关的安全与滥用风险。然而,其中大部分聚焦于单智能体情形,和/或缺失访问控制等基本工程防护的设置,揭示出多智能体系统中威胁建模的匮乏。我们研究一种流行的多智能体模式——编排器(orchestrator)设置——的安全漏洞,其中中央智能体将任务分解并委派给专职智能体。通过对一个代表未来可能用例的具体设置开展红队测试,我们展示了一种新型攻击向量OMNI-LEAK,它攻陷多个智能体,通过单次间接提示注入泄露敏感数据,即使在存在数据访问控制时也是如此。我们报告了前沿模型对不同类别攻击的易感性,发现推理型与非推理型模型均易受攻击,即使攻击者缺乏对实现细节的内部知识。我们的工作凸显了安全研究从单智能体泛化到多智能体设置的重要性,以降低现实世界隐私泄露、经济损失以及对AI智能体公众信任方面的严重风险。

OMNI-LEAK:编排器多智能体网络引发的数据泄露
图1:编排器(Orchestrator)系统示意图。用户与 orchestrator agent 交互,该智能体进而可以访问许多下游智能体,每个下游智能体都按其专门功能设计,拥有各自的系统提示词和工具。