论文
TILDE:基于 TILt 的分布式擦除用于概念遗忘
TILDE: TILt-based Distributional Erasure for Concept Unlearning
摘要
文本到图像扩散模型中的概念遗忘对于安全和实际部署至关重要:随着隐私问题、版权纠纷、商标限制和安全法规的不断增加,部署的系统必须能够在训练后抑制不需要的概念。现有的方法通常会有效地去除目标概念,但实际的遗忘还需要一个同样基本的属性:遗忘的模型应该保留良性生成的质量、多样性和语义覆盖。黄金标准是从头开始训练的仅保留模型,没有不需要的数据。然而,常见的擦除目标并未指定哪种遗忘后分布应近似该参考,从而使保留成为更新规则的隐含结果。我们提出了 TILDE,即基于 TILt 的分布擦除,它将概念遗忘表述为分布对齐问题:期望的目标是在遗忘约束下预训练模型的最小偏差条件分布。这种能量倾斜、无锚点的目标抑制概念表达图像,同时为每个提示保留良性相对质量。我们通过残差 $\nabla$-GFlowNet 训练来实例化这一原理,该训练学习由相对于预训练扩散模型的遗忘能量引起的分数校正。跨越对象、艺术风格和角色,TILDE 实现了强大的遗忘,同时比之前的基线提高了记忆力和分布保真度。