论文

ICED:通过可解释的概念分解实现概念级机器遗忘

ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition

模型训练模型编辑与遗忘

摘要

视觉语言模型(VLM)中的机器取消学习通常在图像或实例级别执行,因此很难在不影响不相关语义的情况下精确删除目标知识。这个问题尤其明显,因为单个图像通常包含多个纠缠的概念,包括要忘记的目标概念和应该保留的上下文信息。在本文中,我们提出了一种用于 VLM 的可解释概念级遗忘框架,该框架使用多模态 大语言模型 从遗忘集中构建紧凑的特定于任务的概念词汇表。除了模态对齐之外,视觉表示还被分解为稀疏的、非负的语义概念组合,为细粒度的知识操作提供了一个显式的接口。基于这种分解,我们的方法将取消学习表述为概念级优化,其中目标概念被选择性地抑制,同时保留实例内非目标语义和全局跨模态知识。跨域内和域外遗忘设置的大量实验表明,与现有的 VLM 去学习方法相比,我们的方法能够实现更全面的目标遗忘,更好地保留同一图像内的非目标知识,并保持有竞争力的模型效用。