论文
DynaTrust:基于动态信任图防御多智能体系统中的潜伏智能体
DynaTrust: Defending Multi-Agent Systems Against Sleeper Agents via Dynamic Trust Graphs
摘要
基于大语言模型的多智能体系统(MAS)展现了出色的协作推理能力,但也引入了新的攻击面,例如潜伏智能体(sleeper agent):它们在常规运行中表现良性并逐渐积累信任,只有在满足特定条件或触发器时才显露恶意行为。现有防御工作主要聚焦于静态图优化或分层数据管理,往往难以适应不断演化的对抗策略,或因僵化的阻断策略而承受高误报率(FPR)。为解决这一问题,我们提出 DynaTrust,一种针对潜伏智能体的新型防御方法。DynaTrust 将 MAS 建模为动态信任图(DTG),把信任视为持续演化的过程而非静态属性。它基于各智能体的历史行为和所选专家智能体的置信度动态更新其信任。DynaTrust 不只是简单阻断,而是自主重构图结构以隔离被攻陷的智能体并恢复任务连通性,从而保证 MAS 的可用性。为评估 DynaTrust 的有效性,我们在由 AdvBench 和 HumanEval 派生的混合基准上对其进行评测。结果表明,DynaTrust 将防御成功率提升 41.7%,优于最先进方法 AgentShield,在对抗条件下防御成功率超过 86%。此外,它通过显著降低 FPR 有效平衡了安全性与实用性,并通过图适配确保系统运行不中断。
