论文

忘记所有这些的一种方式:增强视觉语言模型中的跨模态遗忘

One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models

模型训练模型编辑与遗忘

摘要

机器遗忘被广泛用于消除 大语言模型 中的危险知识。然而,现代视觉语言模型(VLM)同时处理文本和视觉输入,这就提出了一个基本的安全问题:一种模式中的遗忘是否会转移到另一种模式中?我们提出了跨三种 VLM 架构的跨模态去学习迁移的第一个系统性、双向研究:LLaVA-1.5(MLP 投影)、InstructBLIP(Q-Former)和 IDEFICS(门控交叉注意力)。我们发现忘却可以跨模式迁移,但这种迁移是不对称且不完整的。在某些情况下,文本遗忘会强烈地转移到视觉上。然而,在操纵文本视觉呈现的印刷攻击下,这种鲁棒性不会得到保留。在这种攻击下,以前忘记的知识可以很容易地恢复,这表明浅层忘记。为了解决转移差距和浅层鲁棒性,我们提出了 \textsc{CrossInf},一种影响引导的缓解策略。由于观察到不同的模型组件对跨模态迁移的贡献不同,\textsc{CrossInf} 重点关注对最影响跨模态泛化的 Transformer 块的学习。它在强融合的架构中将传输间隙减少了一半以上,同时保留了模型的实用性。它还提高了印刷攻击下的鲁棒性,将攻击成功率降低到接近于零。我们进一步使用三个注释器 ($κ{=}0.77$) 进行人类评估,以验证我们的发现。最后,我们使用中心核对齐(CKA)分析浅层遗忘,提供对观察到的迁移行为和鲁棒性限制的见解。