论文
一种扰动,两种故障模式:通过嵌入引导的印刷扰动探测 VLM 安全性
One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations
摘要
印刷提示注入利用视觉语言模型 (VLM) 读取图像中呈现的文本的能力,随着 VLM 为自主代理提供动力,构成了越来越大的威胁。先前的工作通常侧重于最大化攻击成功率(ASR),但没有解释\emph{为什么}某些渲染绕过安全对齐。我们做出了两项贡献。首先,针对包括 GPT-4o 和 Claude 在内的四种 VLM、12 种字体大小和 10 种转换的实证研究表明,多模态嵌入距离可以强烈预测 ASR($r{=}{-}0.71$ 到 ${-}0.93$、$p{<}0.01$),从而提供可解释的、与模型无关的代理。由于嵌入距离可以预测 ASR,因此减少嵌入距离应该可以提高攻击成功率,但这种关系由两个因素调节:感知可读性(VLM 是否可以解析文本)和安全对齐(是否拒绝遵守)。其次,我们将其用作红队工具:我们通过 CWA-SSA 在四个代理嵌入模型上直接最大化有限 $\ell_\infty$ 扰动下的图像文本嵌入相似性,对这两个因素进行压力测试,而无需访问目标模型。在 GPT-4o、Claude Sonnet 4.5、Mistral-Large-3 和 Qwen3-VL 上进行的五种退化设置的实验证实,优化恢复了可读性并减少了安全对齐拒绝,这是两种同时发生的效应,其主要机制取决于模型的安全过滤器强度和视觉退化程度。