论文

通过渐进式分辨率处理和自适应特征对齐对 MLLM 进行对抗性攻击

Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

模型评测安全与风险评测

摘要

对抗性扰动可能会误导多模态 大语言模型 (MLLM) 将良性图像识别为特定目标对象,从而在自动驾驶和医疗诊断等安全关键场景中带来严重风险。这使得基于传输的有针对性的攻击对于理解和提高黑盒 MLLM 的稳健性至关重要。现有的基于转移的有针对性的攻击方法通常依赖于代理编码器的最终全局特征和对原始分辨率目标作物的锚点优化,导致其可转移性和鲁棒性有限。为了应对这些挑战,我们提出了渐进式分辨率处理和自适应特征对齐(PRAF-Attack),这是一种基于传输的有针对性的攻击框架,它将多尺度全局语义指导与强大的中间层局部对齐相结合。与仅对齐代理编码器的最后一层的先前方法不同,我们设计了一种自适应特征对齐策略,利用中间表示来增强可转移性。具体来说,我们引入了一种自适应中间层选择机制,通过梯度一致性来识别跨代理集合的可转移分层特征,以及一种自适应补丁级优化策略,通过有效的补丁过滤保留高度相关的局部区域。为了克服对固定原始分辨率目标作物的依赖,我们提出了一种渐进式分辨率处理策略,从粗到细逐步细化优化,使攻击能够更好地利用多个尺度的目标信息并实现更强的可迁移性。我们在各种黑盒 MLLM 套件上评估 PRAF-Attack,包括六个开源模型和六个闭源商业 API。与七个最先进的针对性攻击基线相比,所提出的 PRAF-Attack 始终实现了卓越的可转移性。