论文

SAIGuard:LLM 多代理系统主动防御的通信状态仿真

SAIGuard: Communication-State Simulation for Proactive Defense of LLM Multi-Agent Systems

智能体系统Agent 动作执行与治理

摘要

基于 LLM 的多代理系统 (MAS) 通过代理间协作解决复杂任务,但其通信驱动的性质也允许安全风险在代理之间传播并触发系统范围的故障。现有的 MAS 防御主要在执行后通过检测和隔离有害代理遵循反应范式,这可能会造成不可逆转的损害并降低协作效用。为了解决这个问题,我们提出了一个 MAS 安全的主动防御框架,即模拟感知拦截防护(SAIGuard)。 SAIGuard 在 MAS 交互图上执行通信状态模拟,估计传入消息对本地代理状态和全局 MAS 状态的影响,并通过重建与良性通信模式的偏差来检测有风险的消息。 SAIGuard 不是隔离代理,而是在可疑消息传播到系统之前对其进行清理或重新生成。跨不同拓扑和攻击场景的实验表明,SAIGuard 在保持 MAS 实用性的同时降低了攻击成功率,性能优于反应式防御。