论文
本地化和中和:针对视觉提示注入攻击的梯度引导词元抑制
Localize and Neutralize: Gradient-guided Token Suppression against Visual Prompt Injection Attack
摘要
对抗性图像通过即时注入对多模式 大语言模型 构成严重的安全威胁。现有的防御措施很大程度上缺乏对潜在机制的原则性理解,并且难以平衡效率和防御效用。在这项工作中,我们表明成功的对抗性攻击并不统一依赖于整个图像,而是依赖于关键图像标记的一小部分。基于这一见解,我们提出了梯度词元屏蔽(GTM),它通过梯度分析来定位这些词元,并通过屏蔽来中和它们。我们发现,当攻击保留预测词元时,基于第一个生成词元的输出概率的归因会失败。为了克服这个问题,GTM 利用隐藏状态梯度范数得分来进行对抗性输入下的生成影响力归因。我们证明其排名与全对抗性损失梯度的排名一致,为精确定位提供了理论保证。我们的方法只需要一次前向-后向传递即可识别少量高分词元并将其归零,从而有效地破坏对抗性攻击路径。关于即时注入和多模式越狱攻击的大量实验表明,我们的方法将攻击成功率(ASR)降低到接近于零,同时保持模型实用性,计算开销可以忽略不计。