论文

动态视频生成:跨越时间和空间塑造视频生成

Dynamic Video Generation: Shaping Video Generation Across Time and Space

模型推理推理加速

摘要

扩散模型在视频生成方面取得了令人印象深刻的性能,但由于每个时间步处理大量标记,因此其迭代去噪过程的计算成本仍然很高。最近,渐进分辨率采样通过降低早期阶段的潜在分辨率而成为一种有前途的加速方法。然而,将这一想法扩展到视频生成仍然具有挑战性,因为额外的时间维度在不同视频中引入了不同的时空需求,并且仅压缩单个维度通常会导致加速有限或质量下降。因此,我们提出了 DVG,一种动态视频生成框架,它跨时间和空间联合分配计算,自动选择内容感知加速策略,无需手动调整或重新训练。 DVG 在模型和任务上实现了近乎无损的加速,在 HunyuanVideo 和 HunyuanVideo-1.5 上实现了高达 7 倍的加速,与 蒸馏 结合时达到了 18 倍,展示了其作为当今大规模高效视频生成系统关键组件的潜力。我们的代码位于补充材料中,并将在 Github 上发布。