论文

在几个步骤的蒸馏文本到图像扩散模型中实现偏好驱动的遗忘

Enabling Preference-driven Unlearning in Few-step Distilled Text-to-Image Diffusion Models

模型训练偏好优化模型编辑与遗忘

摘要

文本到图像的扩散模型越来越多地被分解为几个步骤的变体,并被部署以实现快速推理。然而,它们生成有害或不需要的内容的能力带来了重大的安全风险。数据驱动的忘却方法通过使用专门的忘却目标微调模型权重来抑制目标生成。至关重要的是,这些目标隐含地依赖于多步去噪动力学,这种假设对于少步蒸馏(FSD)模型来说是不成立的,导致无效的遗忘。此外,对非蒸馏基础模型执行取消学习并随后重新蒸馏以获得未学习的 FSD 模型会产生大量的计算和时间开销,使其在许多设置中不切实际。因此,我们通过偏好驱动的遗忘框架来解决这一限制,该框架重新审视扩散模型的直接偏好优化(DPO)。我们表明,围绕噪声预测误差制定的标准 DPO 及其不可学习的导数,由于其生成动态的改变,很难迁移到 FSD 模型。克服 为此,我们引入了一种修改后的偏好优化公式,该公式与少步生成属性明确一致,从而能够在 FSD 模型中直接删除概念,同时保留少步效率并保持所需(非目标)能力的强烈保留。我们主要根据身份和 NSFW(裸露)去除任务来评估我们的框架,并将我们的方法扩展到对象级遗忘。大量的实验证明了一致且有效的遗忘以及强大的保留性能,使我们的方法成为 FSD 模型中遗忘的实用且有原则的解决方案。