论文
注意力劫持:视觉语言模型中跨查询的响应操作
Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models
摘要
现有的对视觉语言模型(VLM)的对抗性攻击可以将模型输出引导至攻击者指定的目标响应,但当相同的扰动输入与不同的文本查询配对时,其有效性通常会降低。本文研究了跨查询响应操作,其中单个对抗性示例预计在不同的用户查询中保持有效。我们首先分析现有攻击的局限性,发现成功的转移与在响应生成过程中保留图像主导的注意力模式密切相关。受观察的启发,我们提出了 \textbf{注意力劫持},这是一种新颖的对抗性攻击,它明确地将内部注意力分布转向持久的图像主导模式。通过放大视觉标记对目标响应标记的影响,同时抑制文本标记的竞争影响,我们的方法减少了操纵输出对查询的特定措辞的依赖性。对广泛使用的 VLM 进行的大量实验表明,注意力劫持极大地提高了跨不同目标响应和未见查询的跨查询可转移性。该方法还有效地扩展到多种攻击场景,为 VLM 可转移响应操作中注意力稳定性的作用提供了新的见解。