论文

用于多模态的视觉噪声引导上下文 蒸馏 大语言模型 遗忘

Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning

模型训练模型编辑与遗忘

摘要

多模态 大语言模型 (MLLM) 在视觉语言任务上取得了显着进展,但它们也可能会记住和暴露敏感或受限知识,引发对隐私和更广泛安全风险的担忧。机器取消学习(MU)提供了一种有前途的方法,可以从训练的模型中删除有针对性的不需要的知识,而无需从头开始重新训练,同时保留一般模型的实用性。然而,MLLM 中有效的忘却仍然特别具有挑战性。现有的基于训练的方法常常难以平衡忘却有效性和模型效用。相比之下,无需训练 方法(例如上下文取消学习)通过避免参数更新来保留模型效用,但它们不会删除参数级别的记忆知识,并且可能仍然容易受到逆向工程攻击。更重要的是,在多模态环境中,上下文遗忘是不够的,在多模态环境中,视觉输入可以提供强烈的调节信号并引起不良输出。为了应对这些挑战,我们提出了视觉噪声引导上下文 蒸馏 (VGID),这是一种基于 蒸馏 的 MLLM 去学习框架。 VGID 通过将视觉扰动与文本上下文遗忘相结合的双模态干预,从冻结的基础模型动态构建面向遗忘的教师分布。由此产生的干预诱导分布充当 蒸馏 的教师信号,引导学生模型走向参数级忘却,而无需外部教师模型或明确的不良响应注释。实验结果表明,VGID 在保持竞争模型效用的同时实现了强大的忘却效果,在代表性设置中将遗忘集 ROUGE-L 减少了 0.371,而保留集 ROUGE-L 仅下降了 0.055。