论文
并非所有帧都值得完整计算:通过选择性计算和预测外推加速自回归视频生成
Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation
摘要
自回归 (AR) 视频扩散模型可以生成长格式视频,但由于重复的多步骤去噪,成本仍然很高。现有的 无需训练 加速方法依赖于二进制缓存或重新计算决策,忽略了直接重用过于粗糙但不需要完全重新计算的中间情况。此外,异步 AR 调度为共同生成的帧分配不同的噪声级别,而现有方法统一处理整个有效间隔。为了解决这些 AR 特有的低效率问题,我们提出了 SCOPE,这是一个用于高效 AR 视频传播的 无需训练 框架。 SCOPE 引入了一种针对缓存、预测和重新计算的三模式调度程序,其中通过噪声级泰勒外推法进行的预测通过由错误传播分析支持的显式稳定性控制填补了重用和重新计算之间的空白。它还引入了选择性计算,将执行限制在活动帧间隔内。在 MAGI-1 和 SkyReels-V2 上,SCOPE 实现了高达 4.73 倍的加速,同时保持与原始输出相当的质量,优于所有 无需训练 基准。