论文
ACIArena:迈向智能体级联注入的统一评估
ACIArena: Toward Unified Evaluation for Agent Cascading Injection
摘要
协作与信息共享赋能多智能体系统(MAS),但也引入了一种被称为智能体级联注入(Agent Cascading Injection, ACI)的关键安全风险。在此类攻击中,被攻陷的智能体利用智能体间的信任传播恶意指令,导致整个系统发生级联失效。然而,现有研究只考虑有限的攻击策略和简化的MAS设置,限制了其可泛化性与全面评估。为弥合这一差距,我们提出ACIArena,一个用于评估MAS鲁棒性的统一框架。ACIArena提供系统性评估套件,覆盖多种攻击面(即外部输入、智能体档案、智能体间消息)与攻击目标(即指令劫持、任务破坏、信息窃取)。具体而言,ACIArena建立了统一规范,同时支持MAS构建与攻防模块。它覆盖六种广泛使用的MAS实现,并提供包含1,356个测试用例的基准,用于系统性地评估MAS鲁棒性。我们的基准测试结果表明,仅通过拓扑评估MAS鲁棒性是不够的;鲁棒的MAS需要精心的角色设计与受控的交互模式。此外,在简化环境中开发的防御往往无法迁移到真实场景;范围狭窄的防御甚至可能引入新的漏洞。ACIArena旨在为更深入地探索MAS设计原则提供坚实基础。
