论文
两者不可兼得:概念纠缠限制了扩散模型的忘却
You Can't Have It Both Ways: Concept Entanglement Limits Diffusion Model Unlearning
摘要
文本到图像扩散模型中的概念遗忘旨在抑制目标概念(例如 \texttt{horse}),同时保留相关但不同的内容(例如 \texttt{donkey}),但现有方法要么在间接提示下泄漏,要么明显降低其他概念。我们证明这些失效模式源于概念表示的几何形状,而不是任何特定的算法。将概念形式化为激活空间区域,我们证明目标和其他概念之间的重叠可以降低任何鲁棒擦除对它们造成的损害,并根据重叠程度线性地进行权衡。在 13 种遗忘方法中,包括旨在保留非目标概念的方法,没有一种方法能够同时实现强擦除和强邻居保留:STEREO 几乎消除了间接泄漏,但将邻居生成减少了 75% 以上,而稀疏推理时间方法保留邻居但泄漏。损害随着我们的重叠测量而增加,对于 STEREO 来说是单调的; $\kappa$ 缩放在 SDXL 上重现,邻居选择性损坏在 FLUX 上重现。完美忘却是纠缠概念的错误目标;方法应该在我们的定理建立的帕累托前沿上进行评估。