论文

概念不止于一个词:文本到图像扩散模型中的多样化遗忘

A Concept is More Than a Word: Diversified Unlearning in Text-to-Image Diffusion Models

模型训练模型编辑与遗忘

摘要

概念遗忘通过从模型参数中选择性擦除不良概念,已成为降低文本到图像扩散模型有害内容生成风险的一个有前景的方向。现有方法通常依赖关键词来识别待遗忘的目标概念。然而我们证明,这种基于关键词的表述存在固有局限:视觉概念是多维的,可以用多样的文本形式表达,并且在潜空间中常与相关概念交叠,因此仅凭关键词的不精确指示进行遗忘是脆弱且容易过度遗忘的。其原因在于,单个关键词只代表概念的一个狭窄点估计,无法覆盖其在潜空间中的完整语义分布和纠缠变化。为解决这一局限,我们提出Diversified Unlearning,一个用一组上下文多样的提示而非单一关键词来表征概念的基于分布的框架。这种更丰富的表征使遗忘更精确、更鲁棒。通过在多个基准和最先进基线上的大量实验,我们证明将Diversified Unlearning作为附加组件集成到现有遗忘流程中,能够持续实现更强的擦除效果、更好地保留无关概念,并提升对对抗性恢复攻击的鲁棒性。