论文

针对多模态多智能体推理的层级化攻击

Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning

模型评测安全与风险评测

摘要

多模态多智能体系统(MM-MAS)因能够在多种模态间实现复杂推理与协调而日益受到关注。随着这些系统的规模和功能持续扩张,研究其潜在脆弱性变得越来越重要。然而,现有多智能体系统对抗攻击研究主要聚焦于孤立智能体或单模态设置,使MM-MAS的脆弱性在很大程度上未被充分探索。为填补这一空白,我们提出HAM$^{3}$,一个面向多模态多智能体系统的层级攻击(Hierarchical Attack)框架,它将攻击分解为三个相互关联的层。具体而言,在感知层,HAM$^{3}$通过扰动视觉输入、文本输入及其融合的视觉-文本表示发起攻击。在通信层,它实施破坏消息内容和交互拓扑的通信级攻击,例如操纵共享上下文或通信链路以扭曲集体信息流。在推理层,它实施干扰各智能体认知流水线的推理级攻击,使推理轨迹产生偏倚并最终损害最终决策。我们在GQA基准上,通过基于ReAct、Plan-and-Solve和Reflexion等不同推理范式构建的多智能体系统评估HAM$^{3}$。实验表明,我们的框架实现了最高78.3%的攻击成功率,其中推理层攻击最为有效。超过一半的成功攻击会诱使多个智能体产生一致的错误。这些发现为构建更鲁棒、更可解释的多智能体智能提供了宝贵洞见。

针对多模态多智能体推理的层级化攻击:论文配图
图2:HAM3攻击框架在多模态多智能体推理范式下的分层攻击总览。