论文
动态少步:统一动态计算和少步 蒸馏 以实现高效视频生成
Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation
摘要
视频扩散模型 (VDM) 已展现出卓越的生成质量,但计算成本却过高。虽然最近的几个步骤 蒸馏 技术显着加速了推理,但它们通常在所有降噪阶段强制执行静态模型架构,忽略了不同噪声水平固有的不同计算需求。在这项工作中,我们提出了一种新颖的 后训练 加速框架,该框架通过将动态结构稀疏化直接集成到 蒸馏 过程中来利用这种冗余。与应用于固定扩散管道的传统事后压缩不同,我们的方法联合优化了去噪步骤和结构化模型稀疏性,将预训练的 VDM 转换为紧凑的、特定于步骤的模型混合 (MoM)。为了解决联合优化带来的训练不稳定问题,我们引入了渐进训练策略和输出轨迹展开机制,确保跨时间步长的结构决策的连贯学习。此外,我们开发了一个专门的推理引擎来有效地部署生成的 MoM。我们的方法与现有的加速技术正交并且非常有效:在 Wan-14B 上,它在 4 步 蒸馏 的基础上消除了 24% 的每步 FLOP,增加了 1.2 倍的挂钟增益,比 50 步教师实现了 30 倍的加速,同时保持了有竞争力的生成质量。