论文
Mask Forcing:双噪声掩码采样改善自回归视频扩散蒸馏
Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout
摘要
自回归(AR)视频扩散模型在实时视频生成方面显示出巨大的潜力。最近的方法通过分布匹配 蒸馏 (DMD) 将预训练的双向视频扩散模型提炼为因果 AR 学生,但生成的视频经常遇到过饱和和过度平滑的问题,导致视觉质量和真实感有限。关键的影响因素是 DMD 中反向 KL 目标的模式搜索行为,这可能导致学生分布崩溃到教师分布的少数模式上。为了解决这个问题,我们提出了 Mask Forcing,这是一种双噪声掩蔽采样轨迹策略,可以扰乱 AR 学生的自我采样轨迹,以减轻反向 KL 模式搜索引起的模式崩溃。核心思想是在 AR 扩散 蒸馏 的自采样轨迹过程中,通过沿空间和时间轴的随机掩模将更清晰的信号注入到嘈杂的采样轨迹输入中。这种扰动鼓励学生探索教师分布的更多区域,从而使 DMD 能够提供超出学生已经涵盖的模式的学习信号。此外,更干净的词元可以作为其他噪声较大词元的去噪指导,从而改进中间采样轨迹预测并减少错误累积。大量实验表明,我们的方法有效地改进了多种 AR 视频扩散 蒸馏 方法,具有更高的视觉质量,无需合并真实视频数据或额外的 后训练 阶段。