论文

剔除坏种子:文本到图像扩散模型的初始噪声鲁棒忘却

Weeding Out Bad Seeds: Initial-Noise-Robust Unlearning for Text-to-Image Diffusion Models

模型训练模型编辑与遗忘

摘要

机器遗忘已成为一种关键的事后安全措施,可以在不进行禁止性再训练的情况下从文本到图像 (T2I) 模型中删除敏感概念。然而,我们发现,由于严重缺乏对噪声初始化的鲁棒性,当前最先进的(SOTA)方法很脆弱。我们将这种现象称为“概率遗忘”:被抑制的概念在特定的随机初始噪声条件下重新出现,尽管在其他初始化中似乎没有被学习。我们将这种失败归因于遗忘过程中标准高斯采样与遗忘目标之间的不一致。由于目标概念仅在整个遗忘阶段的特定初始噪声区域中显现,因此均匀随机采样会产生稀疏、无信息的梯度更新,无法驱动稳健的擦除。为了克服这个问题,我们提出了一种自适应的、以概念为条件的采样策略,该策略动态地将梯度更新集中在目标概念出现的区域,从而降低无信息区域的权重。我们将我们的框架与跨四个扩散主干的六种不同的 SOTA 忘却方法集成在一起,并在安全性、对象和艺术风格忘却以及黑盒和白盒对抗攻击下对其进行评估。我们的方法在四个基线上平均将随机初始化的条件裸露重新出现率降低了 67.2%,并降低了两个对抗性评估的攻击成功率。在各个概念领域,自适应噪声采样增强了对抗鲁棒性和非目标保留,同时保持有竞争力的生成质量和目标擦除性能。