论文
概念分离扩散遗忘的解开稀疏表示
Disentangled Sparse Representations for Concept-Separated Diffusion Unlearning
摘要
忘记文本到图像扩散模型中的特定概念对于防止不良内容的生成变得越来越重要。在现有方法中,基于稀疏自动编码器(SAE)的方法因其能够通过对潜在特征的轻量级操作来抑制目标概念而无需修改模型参数而引起了人们的关注。然而,使用稀疏重建目标训练的 SAE 并没有明确强制执行概念方面的分离,从而导致跨概念共享潜在特征。为了解决这个问题,我们提出了 SAEParate,它通过概念感知对比目标将潜在表示组织成特定于概念的集群,从而实现更精确的概念抑制,同时减少遗忘过程中的意外干扰。此外,我们通过基于 GeLU 的非线性变换增强了编码器,以提高其在此分离目标下的表达能力,从而实现更具辨别力和解缠结的潜在空间。 UnlearnCanvas 上的实验展示了最先进的性能,在联合风格对象取消学习方面取得了特别强劲的成果,这是一个具有挑战性的环境,其中现有方法遭受目标和非目标概念之间的严重干扰。