论文

PropGuard:通过传播感知探索和修复保护 LLM-MAS

PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation

智能体系统Agent 动作执行与治理

摘要

基于 LLM 的多智能体系统(LLM-MAS)已成为通过角色专业化、工具使用、记忆和协作推理来解决复杂任务的有前途的范例。然而,这些交互产生了新的安全风险,通过消息、工具或内存注入的恶意指令可以在代理和轮次之间传播,从而导致系统级危害。现有的防御很大程度上依赖于本地过滤或基于图形的异常检测,但它们通常无法跟踪细粒度的传播路径或在不破坏良性协作的情况下修复受污染的状态。我们提出了 PropGuard,一种用于保护 LLM-MAS 的传播感知框架。 PropGuard构建了一个双视图时空图,它将以响应为中心的风险估计与全状态证据保存相结合。在这些风险先验的指导下,经过 GE-GRPO 培训的检查员会依次探索全状态图,以恢复紧凑的可疑传播子图。然后,PropGuard 通过子图感知诊断来验证有害传播,并应用源引导修复来纠正上游污染并重播受影响的下游交互。跨四种通信架构和五种攻击设置的实验表明,PropGuard 持续降低攻击成功率,同时保持较高的任务级别防御成功率,从而实现有利的有效性-效率权衡。