论文
文本到图像扩散模型的投影梯度遗忘:防御概念复兴攻击
Projected Gradient Unlearning for Text-to-Image Diffusion Models: Defending Against Concept Revival Attacks
摘要
文本到图像扩散模型的机器取消学习旨在有选择地从预训练模型中删除不需要的概念,而无需进行昂贵的再训练。当前的忘却方法有一个共同的弱点:当模型对下游数据进行微调时,即使该数据完全不相关,被删除的概念也会返回。我们将投影梯度遗忘(PGU)从分类调整到扩散域,作为事后强化步骤。通过从保留概念激活构建核心梯度空间(CGS)并将梯度更新投影到其正交补集,PGU 确保后续的 微调 无法撤消已实现的擦除。该方法应用在现有方法(ESD、UCE、Receler)之上,消除了风格概念的复兴,并大大延迟了对象概念的复兴,运行时间约为 6 分钟,而 Meta-Unlearning 则需要约 2 小时。 PGU 和 Meta-Unlearning 是互补的:哪个表现更好取决于概念的编码方式,而保留概念选择应该遵循视觉特征相似性而不是语义分组。