论文
数据强制 蒸馏:在几步视频生成中恢复多样性和保真度
Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation
摘要
最近的进展显示出将多步骤视频扩散模型提炼为高效的少步骤学生的希望。其中,分布匹配蒸馏(DMD)及其后继者DMD2实现了强大的生成质量和快速收敛。然而,由于反向 Kullback-Leibler (KL) 目标的性质,这些方法表现出两种持续的失败模式:样本多样性大幅下降,以及明显偏离真实视频外观的过饱和输出。在这项工作中,我们提出了 Data-Forcing 蒸馏 (DFD),这是一个简单的 后训练 框架,只需更改一行代码即可恢复 DMD 中的多样性和保真度。其核心是教师分数差异,以引导学生走向真实数据分布,将其拉向缺失模式(减轻模式崩溃)并远离真实数据中不存在的有问题的模式(避免过度饱和)。我们对我们的框架进行了深入的理论分析,并验证了我们在文本到视频、图像到视频和自回归视频生成方面的方法。只需 100--300 步的微调,DFD 就可以在 Wan2.1-1.3B 和 Cosmos-Predict2.5-2B 模型上有效恢复多样性和保真度,解决过饱和伪影,视频动态和外观明显更好,甚至优于教师模型。