论文
FADE:基于帧感知扩散 Transformer 的视频多概念遗忘
FADE: Frame-Aware Diffusion-Transformer-based Multi-Concept Erasure for Video Unlearning
摘要
文本到视频 (T2V) 扩散模型可以复制受版权保护的、暴力或露骨的内容,这会引发概念擦除:从预训练模型中删除指定的概念,同时保留其在其他所有内容上的行为。现有的 T2V 擦除方法存在两个问题。它们与帧无关的抑制可能会留下孤立的帧,其中被擦除的概念重新出现,这是剪辑级别平均模糊的帧重新激活间隙;并且通常一次用一个目标概念或类别来评估它们。我们提出了帧感知扩散擦除(FADE),这是一种多概念视频 遗忘 框架。 FADE 首先应用联合封闭式键/值编辑来抑制所有目标概念,然后训练每个概念帧感知的低秩适配器,其强度由帧索引和去噪时间步进行门控,以消除残留的每帧泄漏。每个适配器都使用其他目标的提示作为硬否定进行训练,这使不同适配器的概念特定组件很好地分离,并且基于相似性的软路由器根据提示组合适配器。从单个 Wan2.1-T2V-1.3B 骨干模型 中删除了 16 个概念(物体、艺术风格和裸体)后,FADE 将物体基准的残余精度降低至 4.9%,而八个基准中最强的基准为 15.5%,同时将 VBench 平均值保持在未编辑模型的 0.9% 以内。在 VLM 法官和盲人研究下,排名保持不变,并且相对于最强基线的优势延续到组合了多个已删除概念的提示、30 个同时删除的名人身份以及 Wan2.1-T2V-14B、CogVideoX-2B 和 HunyuanVideo-1.5。
