论文

通过抑制交叉编辑干扰来持续消除扩散模型中的概念

Continual Concept Erasure in Diffusion Models by Suppressing Cross-Edit Interference

模型训练模型编辑与遗忘

摘要

概念擦除从预训练的文本到图像传播模型中删除受版权保护、隐私敏感或其他不需要的概念,以支持内容治理和合规性。随着擦除请求随着时间的推移到达,模型必须删除新目标而不撤消先前的擦除。现有方法不限制编辑之间的干扰:保留集外部的残余扰动相互作用并累积,降低不相关的世代的质量,有时会将先前删除的目标折叠成噪声。我们提出了 CEASE(通过自适应子空间编辑持续擦除),这是一种无需训练的方法,它对封闭式求解器施加两个子空间约束。 CEASE 将共享替换的词元表示添加到求解器的不变性矩阵中,并且当检测到干扰时,将当前更新投影到从累积的过去更新中提取的主导输出方向的正交补上。封闭形式分解将累积的干扰归因于共享替换的重复激活以及连续更新方向之间的重叠,表明这两个约束抑制了这些各自的源。在对名人、艺术风格和实例的持续擦除中,CEASE 实现了最一致的擦除-保留权衡,而现有方法要么降低总体生成能力,要么不足以擦除目标。