论文
文本到视频模型的推理时间概念抑制和以视频为中心的评估
Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models
摘要
文本到视频(T2V)生成器可以合成逼真且时间连贯的视频,但从生成器中可控地删除目标概念仍然很困难。与文本到图像的概念擦除不同,T2V 遗忘必须抑制可能跨帧持续存在的目标概念,同时保留非目标主题、动作、场景和时间结构。 We propose \textbf{SIRUS}, a 无需训练 inference-time framework for concept-level T2V unlearning.给定目标概念的文本别名,SIRUS 可以在采样期间定位与目标相关的提示证据并抑制目标表达,而无需更新文本编码器或去噪网络。我们进一步引入了一种面向视频的 T2V 去学习评估框架,使用视频级故障标准、帧级残留统计、配对保存分析、基于 VBench 的质量诊断和部署开销测量,分别测量目标遗忘、非目标保留、视频质量、越狱鲁棒性和效率。在 CogVideoX 上的五个安全、对象和风格概念中,SIRUS 达到 70.4% 平均遗忘成功率和 25.7% 平均帧命中率,而 VideoEraser 为 44.4% / 47.2%,同时将平均 VBench 质量下降从 -0.043 减少到 -0.016,在完全评估的基线中产生最强的遗忘质量权衡。 Transfer experiments on Wan2.2 further suggest that SIRUS generalizes across modern T2V backbones.