论文
无视邪恶:通过对抗性注意力劫持使大型视觉语言模型无法接受安全指令
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
摘要
大视觉语言模型 (LVLM) 依靠基于注意力的安全指令检索来在生成过程中保持对齐。现有的攻击通常优化图像扰动以最大化有害输出的可能性,但由于对抗目标和模型的安全检索机制之间的梯度冲突而导致收敛缓慢。我们提出了注意力引导视觉越狱,它通过直接操纵注意力模式来规避而不是压倒安全对齐。我们的方法引入了两个简单的辅助目标:(1)抑制对对齐相关前缀标记的关注,(2)在对抗性图像特征上锚定生成。这种简单而有效的推拉公式将梯度冲突减少了 45%,并在 Qwen-VL 上实现了 94.4% 的攻击成功率(相对于基线的 68.8%),迭代次数减少了 40%。在更严格的扰动预算 ($ε=8/255$) 下,我们保持了 59.0% 的 ASR,而标准方法为 45.7%。机制分析揭示了一种我们称之为安全失明的故障模式:成功的攻击会抑制 80% 的系统提示注意力,导致模型不是通过覆盖安全规则,而是通过无法检索它们来生成有害内容。