论文
随机元遗忘:连接语言骨干和多模态遗忘
Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning
摘要
视觉语言模型 (VLM) 的机器去学习仍未得到充分探索。与语言模型不同,VLM 将语言主干与视觉组件结合在一起,这使得遗忘变得更加复杂。当从单模态遗忘转移到 VLM 遗忘时,会出现一个令人惊讶的现象:当将图像信息提供给完整的 VLM 时,被独立语言主干遗忘的目标仍然可以恢复。这表明纯文本反馈不足以实现可靠的 VLM 忘却。受这一观察的启发,我们提出了随机元取消学习(SMU),这是一个双层框架,它使用 VLM 级反馈来学习准备取消学习的初始化。在内循环中,SMU 使用文本数据对语言主干应用一些遗忘步骤。在外环中,SMU 用冻结的 VLM 重新组合更新后的主干,并评估 VLM 级别的遗忘和效用。这种设计使忘却更新能够意识到最终的多模式行为,同时仍然保持更新在语言主干的本地。对两个 VLM、两个多模态 meme 数据集和三个基线的实验表明,SMU 实现了最佳的整体遗忘-保留权衡。与每个指标的最强基线相比,SMU 将平均遗忘准确度降低了 10.52 分,将平均保留和测试准确度分别提高了 20.10 和 17.01 分。更重要的是,SMU 还迁移到新的遗忘目标和不同的元测试遗忘方法。这些结果表明,VLM 级反馈可以使语言骨干遗忘对于 VLM 来说更可靠、更可迁移。