论文

CleanVideo:文本到视频扩散模型的自适应概念擦除

CleanVideo: Adaptive Concept Erasure for Text-to-Video Diffusion Models

模型推理解码与生成控制

摘要

概念擦除旨在有选择地从预先训练的生成模型中消除不需要的视觉语义,而不损害其通用性。将概念擦除从图像扩展到视频并非易事。目标概念逐渐出现,并随着帧和去噪步骤的不同而变化。因此,固定干预可能会错过目标或导致模糊、抖动和内容失真。我们提出 CleanVideo,一种选择性擦除框架,它执行由三模门控机制控制的低维子空间干预。通过联合处理时空视觉特征、时间步长信号和文本语义,CleanVideo 确定在何处、何时以及是否进行干预,在可以明确定义自然替代概念的同时,将擦除的内容引导至自然替代概念,同时保留非目标内容。对三个视频扩散模型的实验表明,CleanVideo 有效地消除了目标概念,同时保持了视觉保真度和时间连贯性,在帧级和视频级评估以及概念恢复攻击下(当受保护的管道保持完整时)优于现有基线。