论文

GroupGuard:多智能体系统中合谋攻击的建模与防御框架

GroupGuard: A Framework for Modeling and Defending Collusive Attacks in Multi-Agent Systems

智能体系统Agent 动作执行与治理

摘要

尽管基于大语言模型的智能体在协作任务中展现出巨大潜力,它们的交互性也引入了安全漏洞。本文提出并建模了群体合谋攻击——一种极具破坏性的威胁:多个智能体通过社会学策略相互配合以误导系统。为应对这一挑战,我们提出GroupGuard,一个免训练的防御框架,它采用多层防御策略——包括持续的基于图的监控、主动蜜罐诱导和结构剪枝——来识别并隔离合谋智能体。跨五个数据集和四种拓扑的实验结果表明,与个体攻击相比,群体合谋攻击可使攻击成功率最多提高15%。GroupGuard持续取得高检测准确率(最高88%),并有效恢复协作性能,为保障多智能体系统安全提供了一个稳健的解决方案。

GroupGuard:多智能体系统中合谋攻击的建模与防御框架:论文配图
图 1:编码任务中有关删除必要安全检查 (idx != idx2) 的攻击场景。 (a) 在个体攻击场景中,两个恶意代理独立行动,他们无关的论点被良性代理基于事实反驳。 (b) 在群体共谋攻击场景中,恶意代理通过虚假共识策略进行合作,并成功误导了代理 E。