论文
LVLM 的结构引导视觉扰动中和
Structure-Guided Visual Perturbation Neutralization for LVLMs
摘要
图像输入使大视觉语言模型 (LVLM) 能够感知细粒度的视觉信息,但也引入了像素级攻击面,通过该攻击面,对抗性扰动可以引发不安全的模型行为。然而,大多数现有防御措施都是针对传统计算机视觉设置而设计的,因此常常忽视 LVLM 所需的跨模式对齐,从而导致性能下降。同时,针对 LVLM 定制的有限防御通常需要大量的图像修改,并带来相当大的计算开销,从而影响推理质量和效率。为了解决这些限制,我们提出了结构诱导引导中和(SIGN),这是一种轻量级、即插即用的防御框架,可通过先验结构提取提高 LVLM 兼容性,并通过动态引导中和实现有效的扰动抑制。大量实验表明,SIGN 只需 0.5% 像素修改和每张图像 0.16 秒即可实现超过 87% 的防御成功率,同时几乎保留了原始视觉表示和良好的任务性能。我们的工作为需要昂贵的 模型训练 的防御提供了一种轻量级的替代方案,并强调了利用视觉编码器实现高效对抗保护的潜力。我们的代码在 https://anonymous.4open.science/r/SIGN-BCB1 上开源。