论文
为什么基于指令的遗忘在扩散模型中失败?
Why Instruction-Based Unlearning Fails in Diffusion Models?
摘要
基于指令的遗忘已被证明可以有效地修改 大语言模型 在推理时的行为,但这种范式是否扩展到其他生成模型仍不清楚。在这项工作中,我们研究了基于扩散的图像生成模型中基于指令的遗忘,并通过跨多个概念和提示变体的受控实验表明,当仅由自然语言遗忘指令引导时,扩散模型系统地无法抑制目标概念。通过分析去噪过程中的 CLIP 文本编码器和交叉注意力动态,我们发现忘记学习指令不会导致对目标概念标记的注意力持续减少,从而导致目标概念表示在整个生成过程中持续存在。这些结果揭示了扩散模型中即时水平教学的根本局限性,并表明有效的遗忘需要超出推理时间语言控制的干预措施。