论文

重写感知只需很少的功夫:视觉语言模型中的目标语义替换 $ε\leq 4/255$

It Takes Little to Rewrite Perception: Targeted Semantic Substitution in Vision-Language Models at $ε\leq 4/255$

模型评测安全与风险评测

摘要

视觉语言模型(VLM)广泛部署在安全关键场景中,了解对抗性扰动可以在多大程度上控制它们是评估其可信度的先决条件。现有的表示对齐攻击使 VLM 感知目标图像,但在 $\varepsilon \leq 4/255$ 上取得的成功有限。因此,VLM 似乎对此范围内的扰动具有鲁棒性。我们证明这种鲁棒性并不成立,因为目标语义替换在相同范围内成功。具体来说,我们将源图像的每个流与受害者 VLM 合并后词元空间中目标图像中的对应流对齐,在白盒威胁模型下运行。我们根据严格的成功标准进行评估,要求模型同时命名目标、确认其存在并否认来源。在图像中,目标语义出现在 $\varepsilon = 2/255$ 处,完全替换在 $\varepsilon = 4/255$ 处达到 38%。在视频中,完全替换率达到 35.9%,$\varepsilon = 1/255$。我们还观察到一种语义融合现象,即大语言模型(LLM)将矛盾的视觉信号合理化为连贯的叙述。