论文
用于快速生成图像和视频的并行解码 蒸馏
Parallel Decoding Distillation for Fast Image and Video Generation
摘要
由于采样过程缓慢且迭代,视频扩散或流模型的生成在计算上是昂贵的。当前最先进的 (SOTA) 加速方法严重依赖于变分得分 蒸馏 (VSD) 和对抗性损失,将扩散模型提炼为少步生成器。尽管实现了高质量的视频生成,但这些训练损失是出了名的难以优化,并且会遭受模式崩溃,导致视频多样性的损失和缺乏运动。在本文中,我们介绍了并行解码 蒸馏 (PDD),这是一种简化且可扩展的基于轨迹的 蒸馏 方法,用于快速推断扩散和流量匹配模型。我们的架构和训练程序与任何预训练模型兼容,并支持具有不同数量的功能评估(NFE)的采样。 PDD 通过预测每个网络评估的多个去噪步骤来加速生成。从概念上讲,它学习平均速度的表示,而不使用 JVP 或有限差分近似对其导数进行回归。我们的方法在 LTX-2.3 文本到视频/音频、Wan 14B 文本到视频和 Qwen-Image 文本到图像上实现了 4-8 NFE 的 SOTA 性能。此外,PDD 在生成的视频多样性方面呈现出显着的改进。