论文

DSA:用于快速自回归视频生成的动态步骤分配

DSA: Dynamic Step Allocation for Fast Autoregressive Video Generation

模型推理测试时计算扩展

摘要

视频扩散Transformer已经实现了最先进的视觉质量,但其高推理成本仍然是实时应用的主要瓶颈。最近的 蒸馏 框架产生了延迟时间较短的自回归视频扩散模型,但这些模型仍然使用每帧固定数量的去噪步骤,浪费了可预测帧的计算量和对具有挑战性的帧的细化不足。我们提出了 DSA,一种用于 AR 视频扩散的置信引导自适应计算框架。 DSA 引入了一个轻量级置信头,在分布匹配 蒸馏 目标下与生成器联合训练,以估计每帧去噪的可靠性。在推理时,该置信信号动态调整扩散步骤的数量:简单的帧提前终止以提高速度,而复杂的帧则接受额外的细化。我们的方法不需要额外的视频数据,不需要启发式方法,并且几乎不需要架构修改。实验表明,DSA 实现了实时自回归视频生成,在 H100 GPU 上达到 22.63 FPS,延迟为亚秒级,同时与最近的自回归和双向视频扩散模型相比,保持有竞争力或优越的 VBench 质量。我们的结果表明,置信引导的自适应采样为交互式视频生成提供了有效且实用的途径。