论文

EGLOCE:无需训练 概念擦除的能量引导潜在优化

EGLOCE: Training-Free Energy-Guided Latent Optimization for Concept Erasure

模型训练模型编辑与遗忘

摘要

随着文本到图像的传播模型变得越来越普遍,删除特定概念(主要是明确的内容和许多受版权保护的字符或样式)的能力对于安全性和合规性已变得至关重要。现有的遗忘方法通常需要昂贵的重新训练,以降低不相关概念保真度为代价修改参数,或者依赖于间接推理时间调整,从而损害概念擦除的有效性。受到用于保存扩散模型条件的能量引导采样的成功启发,我们引入了概念擦除的能量引导潜在优化(EGLOCE),这是一种 无需训练 方法,通过在推理过程中重新引导噪声潜在来删除不需要的概念。我们的方法采用双目标框架:通过潜在空间中的梯度下降引导生成远离目标概念的排斥能量,以及保持与原始提示的语义对齐的保留能量。与之前需要错误修改模型权重或提供较弱的推理时间指导的方法相结合,EGLOCE 完全在推理中运行并增强了擦除性能,从而实现了即插即用集成。大量实验表明,即使在对抗性攻击的情况下,EGLOCE 也能改善概念去除,同时保持图像质量并迅速跨基线对齐。据我们所知,我们的工作是第一个通过采样期间基于双能量的引导建立安全可控图像生成的新范例的工作。