论文
VisualErase:双分支视觉轨迹重定向,用于文本到图像扩散模型中的稳健概念擦除
VisualErase: Dual-Branch Visual Trajectory Redirection for Robust Concept Erasure in Text-to-Image Diffusion Models
摘要
概念擦除对于文本到图像扩散模型的安全部署至关重要,因为它们可能会复制从不受约束的大规模数据中学习到的有害、受版权保护或隐私敏感的内容。现有方法通常会删除不需要的概念,同时通过重定向与目标相关的文本到图像的映射来保留一般生成能力。然而,最近的研究表明,删除的模型可能仍然保留目标概念的视觉生成轨迹,使它们容易受到对抗性恢复攻击,并揭示了重定向文本到图像映射和真正删除视觉知识之间的根本差距。为了弥补这一差距,我们提出了 VisualErase,这是一种新范式,它将承载概念的视觉生成轨迹重定向到明确定义的概念删除结果。为了实现这种重定向,我们使用保留结构的图像编辑来构建源图像的内容对齐、概念删除的对应部分,从而提供保留非目标内容的显式视觉端点。然后,我们从每个源到对应对中导出一个去噪目标,并使用双分支重定向损失将文本条件和无条件预测与该目标对齐,因为单独的条件监督并不能在没有文本指导的情况下明确约束生成。为了减轻概念擦除对非目标生成的不利影响,我们联合优化重定向损失和与冻结预训练模型的去噪预测相匹配的对应保留损失。在风格、名人和裸露擦除方面,VisualErase 将七次攻击的最大攻击成功率分别限制为 0%、8% 和 0.1%,同时保持一般生成质量。这些结果凸显了视觉轨迹重定向对于鲁棒概念擦除的重要性,而不仅仅是文本到图像的映射。
