论文

概念擦除应该发生在哪里:文本到视频扩散模型中的概念层对齐

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models

模型训练模型编辑与遗忘

摘要

文本到视频的扩散 Transformer 在模型深度上不均匀地编码语义信息,这限制了有效的概念擦除。我们确定了一个表征瓶颈,称为概念层拓扑对齐,在该瓶颈下目标概念在某些表征深度上表现出更高的可分离性。在这些深度之外,概念和非目标信号仍然强烈纠缠在一起,限制了特定深度擦除的有效性。这一观察结果将概念擦除重新定义为识别表征深度的问题,其中概念与非目标分离自然出现。受这种结构约束的推动,我们引入了 CLEAR,这是一种用于概念擦除的可分离性驱动的优化框架,可明确强制执行概念层对齐。 CLEAR 通过将层选择表述为概念-非目标可分离性的优化问题,而不是依赖于层不可知或启发式选择,来实现这一原则。为了实现这一点,我们引入了一个可分离性感知目标,该目标有利于表现出更强的概念-非目标分离的层。大规模文本到视频扩散模型的实验表明,强制概念层对齐可以实现更精确的概念抑制,同时保持整体生成质量。