论文

视频扩散模型中运动概念的遗忘

Motion Concept Unlearning in Video Diffusion Models

模型推理解码与生成控制

摘要

文本到视频 (T2V) 扩散模型可以生成对踢、刺和射击等动作的真实描述,引发安全问题,从而促使有针对性的概念擦除。尽管概念擦除已针对文本到图像和 T2V 模型中的静态概念进行了广泛研究,但擦除运动概念在很大程度上仍未得到探索。我们对视频扩散Transformer(DiT)中的运动概念擦除进行了系统研究。通过因果干预,我们表明文本调节注意力携带特定于概念的运动信息并支持选择性干预,而扰动时间位置编码会抑制目标和非目标动态。我们进一步发现,直接将 ESD(一种代表性权重级图像擦除方法)应用于视频 DiT 会产生适度且不均匀的运动抑制:减少其擦除训练损失本身并不能从条件预测和无条件预测之间的差异中消除概念信号,然后无分类器指导(CFG)在每个去噪步骤中进行缩放。从这些发现中,我们得出运动概念擦除的三个要求:概念特异性、空间选择性和时间自然性。每个都确定 MUTE(文本到视频生成中的运动概念取消学习)的一个组成部分:在每个去噪步骤中,MUTE 通过标记中和提取概念方向,从方向的内在结构中导出空间门,并在应用 CFG 之前从速度输出中减去所得校正。 MUTE 无需训练,无需调整体重。对 20 个运动概念的实验表明,MUTE 优于 Wan2.1-T2V 上的代表性提示级别、权重级别和推理时间基线,并且相同的公式转移到 CogVideoX,支持其在不同 T2V 注意力架构中的适用性。