论文
通过扩散模型的交叉注意激活投影来忘记概念
Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models
摘要
文本到图像扩散模型中现有的用于概念忘却的封闭式方法通常从固定文本嵌入中得出编辑方向,这可能无法完全捕获概念在潜在状态、时间步长和层中的表达方式。为了捕捉这种变化,我们研究了去噪过程中收集的交叉注意力激活。在使用相同锚点提示的受控探测实验中,基于表达目标概念的保留提示,激活衍生碱基的召回率约为文本衍生碱基的五倍。基于这一发现,我们提出了交叉注意力子空间擦除(CASE),这是一种封闭形式的方法,可以构建特定于层的遗忘并保留来自交叉注意力激活的子空间。这些子空间定义了直接合并到交叉注意力权重中的保留约束线性算子,不需要基于梯度的 微调 或额外的推理时间计算。在跨越四个类别的十个概念中,CASE 在所有四个类别的评估基线中取得了最高的调和平均得分,平衡了抑制、保留、对抗鲁棒性和生成质量。进一步的实验证明了在共同忘记多达 100 种艺术风格时对恢复攻击的鲁棒性以及有利的抑制-保留权衡。激活衍生编辑的优势还扩展到更大的扩散模型,包括 SDXL 和 FLUX。