论文
SPARK:表示级 KV 内存对齐以实现更安全的视觉语言模型
SPARK: Representation-Level KV Memory Alignment for Safer Vision-Language Models
摘要
视觉语言模型(VLM)仍然容易受到越狱的影响,越狱会在文本和图像中传播有害意图,从而使得单模式安全机制不足。我们研究是否可以直接在预填充期间形成的多模式键值(KV)内存中缓解此漏洞,而无需在推理时修改模型参数。我们介绍 SPARK,一个用于目标 KV 内存修复的两阶段框架。第一阶段使用一次性诊断适配器来识别多模式键和值表示中与伤害相关的方向。第二阶段投射出这些方向,学习轻量级残差修复,并在保留视觉基础之前用图像结构锚定修复的关键点。 SPARK 不是统一应用干预,而是使用由干预相关子空间能量 E_h 确定的头向系数 g_h* 混合修复记忆和原始记忆,在推理时不需要明确的伤害分类器。在 LLaVA-OneVision-7B、Chameleon-7B、Qwen2-VL-7B 和 InternVL2-4B 中,SPARK 降低了多模式攻击的成功率,同时保留了一般能力。在 LLaVA-OneVision-7B 上,仅图像越狱攻击成功率下降至 4.7%,而 MMMU 与未防御模型的差距保持在 0.6 个百分点以内(47.8 vs. 48.4),且语言质量接近基线。在 MM-SafetyBench 上,攻击成功率从 39.2% 下降到 12.4%。即使在白盒自适应联合提示图像攻击下,攻击成功率也仅限于 20.3%,而未防御模型的攻击成功率为 54.6%。这些结果表明,通过在预填充时有选择地修复与干预相关的 KV 子空间,可以大大减轻多模态越狱行为,特别是当视觉模态携带有害证据时。