论文

击破最弱一环以规避视觉语言模型

Breaking the weakest link to evade vision language models

模型评测安全与风险评测

摘要

视觉语言模型(VLM)近来已成为多模态AI系统的关键组件,能在真实世界与安全关键应用中对视觉与文本输入进行联合推理。尽管部署日益增多,VLM对对抗威胁的鲁棒性仍未被充分探索,尤其是针对多模态对齐的规避攻击。在本工作中,我们研究VLM对施加于视觉输入的对抗扰动的脆弱性,并考察两种攻击设置:无目标攻击,目标是扰乱模型对原始图像的解读;有目标攻击,攻击者试图迫使模型生成与原始图像无关的特定语义描述。为高效生成对抗样本,我们提出一种基于梯度的攻击方法,只在VLM的视觉编码器上优化,而非整个多模态架构。这一设计在保持强攻击有效性的同时,显著降低了攻击的计算成本与资源需求。我们在多个开源VLM上评估该方法,包括Qwen2.5-VL、Granite-Vision、FastVLM和Phi-3.5-Vision,结果表明微小到人眼不可感知的扰动即可大幅改变模型产生的文本解读。我们的发现凸显了现代VLM对对抗操纵的脆弱性,并强调多模态AI系统需要更强的鲁棒性与安全机制。

击破最弱一环以规避视觉语言模型:论文配图
图1:利用视觉编码器嵌入对齐的定向对抗攻击。