论文

像素之间的读取:将文本图像嵌入对齐与视觉语言模型上的排版攻击成功联系起来

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

模型评测安全与风险评测

摘要

我们研究了对视觉语言模型(VLM)的印刷提示注入攻击,其中对抗性文本被渲染为图像以绕过安全机制,随着 VLM 作为自主代理的感知支柱(从浏览器自动化和计算机使用系统到配备摄像头的实体代理),构成了越来越大的威胁。在实践中,攻击面是异构的:对抗性文本以不同的字体大小和不同的视觉条件出现,而不断增长的 VLM 生态系统在漏洞方面表现出巨大的变化,使防御方法变得复杂。在不同字体大小(6--28px)和视觉变换(旋转、模糊、噪声、对比度变化)下评估来自 SALAD-Bench 的 4 个 VLM(即 GPT-4o、Claude Sonnet 4.5、Mistral-Large-3 和 Qwen3-VL-4B-Instruct)的 1,000 个提示,我们发现:(1)字体大小显着影响攻击成功率(ASR),字体非常小(6px) 产生接近于零的 ASR,而中档字体则达到最高效率; (2) GPT-4o(36% vs 8%)和 Claude(47% vs 22%)的文本攻击比图像攻击更有效,而 Qwen3-VL 和 Mistral 在不同模式下显示出类似的 ASR; (3) 两个多模态嵌入模型(JinaCLIP 和 Qwen3-VL-Embedding)的文本-图像嵌入距离在所有四个模型中均与 ASR 呈强负相关(r = -0.71 至 -0.93,p < 0.01); (4) 严重退化使嵌入距离增加 10--12%,ASR 降低 34--96%,而旋转不对称地影响模型(Mistral 下降 50%,GPT-4o 不变)。这些发现强调,特定于模型的鲁棒性模式排除了一刀切的防御,并为从业者为在对抗环境中运行的代理系统选择 VLM 主干提供了经验指导。