论文

Salt:自洽分布匹配与缓存感知训练以实现快速视频生成

Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation

摘要

将视频生成模型提炼为极低的推理预算(例如 2--4 个 NFE)对于实时部署至关重要,但仍然具有挑战性。轨迹风格的一致性 蒸馏 在复杂的视频动态下通常会变得保守,产生过度平滑的外观和微弱的运动。分布匹配 蒸馏 (DMD) 可以恢复清晰的模式搜索样本,但其局部训练信号没有明确规范去噪更新如何跨时间步组合,使得组合式滚动预测容易漂移。为了克服这一挑战,我们提出了自洽分布匹配 蒸馏 (SC-DMD),它明确规范了连续去噪更新的端点一致组成。对于实时自回归视频生成,我们进一步将 KV 缓存视为质量参数化条件,并提出缓存分布感知训练。该训练方案在多步滚动生成中应用 SC-DMD,并引入缓存条件特征对齐目标,将低质量输出引导至高质量参考。通过对非自回归主干网(例如,Wan~2.1)和自回归实时范例(例如,自强迫)的广泛实验,我们的方法,称为 \textbf{Salt},持续提高低 NFE 视频生成质量,同时保持与各种 KV 缓存机制的兼容。项目页面:https://xingtongge.github.io/Salt