论文
揭示视觉语言模型的脆弱性:通过纹理约束扰动和跨模态优化实现多模态对抗协同
Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization
摘要
大视觉语言模型 (LVLM) 改变了多模态理解,通过集成视觉和文本输入,在图像字幕和视觉问答等任务中表现出色。然而,它们针对对抗性攻击(尤其是利用这两种模式的攻击)的鲁棒性仍未得到充分研究,这给自动驾驶和内容审核等关键应用带来了风险。现有的攻击集中于单一模式或需要不切实际的白盒访问,限制了它们在现实世界中的相关性。在本文中,我们介绍了多模态对抗协同,这是一个突破性的框架,可以针对 LVLM 进行通用的黑盒多模态攻击。 MMAS 同时生成图像的纹理尺度受限的通用对抗性扰动和文本的可学习提示扰动,仅使用模型查询进行联合优化。图像扰动利用基于小波的纹理约束来确保不同视觉输入的不可察觉性和鲁棒性。文本扰动受到嵌入空间中 L 范数的约束,在将输出转向目标的同时保持语义连贯性。一种新颖的跨模态正则化项对齐扰动的梯度方向,增强其协同影响以及跨任务和模型的可转移性。大量实验表明,我们提出的针对流行 LVLM 的攻击具有强大的通用对抗能力。