论文

在感染扩散之前捕获它:多智能体系统中的前瞻引导防御

Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems

智能体系统Agent 动作执行与治理

摘要

基于大型多模态模型的多智能体系统(MAS)通过专业化智能体实现复杂问题的协作求解。然而,MAS易受传染性越狱攻击,攻陷单个智能体可能扩散到其他智能体,导致大范围失陷。现有防御通过训练一个更具传染性的治愈因子来对抗,使智能体在检索时偏向它而非病毒对抗样本(VirAE)。然而,这会使智能体响应同质化,只提供表面抑制而非真正恢复。我们重新审视这些通过共享治愈因子进行全局操作的防御,而传染性越狱源于局部化的交互行为。这种错配限制了它们的有效性。为此,我们提出免训练的前瞻引导局部净化(FLP)框架,每个智能体对未来交互进行推理,以跟踪行为演化并清除感染。具体而言,每个智能体模拟后续聊天轮次的未来行为轨迹。为反映MAS中的多样性,我们引入多角色(multi-persona)模拟策略,以在交互情境间实现稳健预测。然后我们以响应多样性作为诊断信号,通过分析基于不同角色预测在检索结果与语义两个层面的不一致性来检测感染。对被感染的智能体,我们施加局部净化:近期感染通过立即相册回滚缓解,而长期感染则采用递归二分诊断(RBD)处理,其递归划分图像相册并应用相同的诊断策略来定位并清除VirAE。实验表明,FLP将最大累计感染率从95%以上降至5.47%以下。此外,检索与语义指标与良性基线几乎持平,表明交互多样性得到有效保持。

在感染扩散之前捕获它:多智能体系统中的前瞻引导防御:论文配图
图1:多智能体系统中攻击与防御的对比:(a)传染性越狱攻击,(b)既有防御,(c)本文前瞻引导防御方法。