论文
GroupGuard:多智能体系统中合谋攻击的建模与防御框架
GroupGuard: A Framework for Modeling and Defending Collusive Attacks in Multi-Agent Systems
摘要
尽管基于大语言模型的智能体在协作任务中展现出巨大潜力,它们的交互性也引入了安全漏洞。本文提出并建模了群体合谋攻击——一种极具破坏性的威胁:多个智能体通过社会学策略相互配合以误导系统。为应对这一挑战,我们提出GroupGuard,一个免训练的防御框架,它采用多层防御策略——包括持续的基于图的监控、主动蜜罐诱导和结构剪枝——来识别并隔离合谋智能体。跨五个数据集和四种拓扑的实验结果表明,与个体攻击相比,群体合谋攻击可使攻击成功率最多提高15%。GroupGuard持续取得高检测准确率(最高88%),并有效恢复协作性能,为保障多智能体系统安全提供了一个稳健的解决方案。
