论文
用于高效自回归视频生成的运动感知缓存
Motion-Aware Caching for Efficient Autoregressive Video Generation
摘要
自回归视频生成范例为长视频合成提供了理论上的希望,但其实际部署却受到顺序迭代去噪的计算负担的阻碍。虽然缓存重用策略可以通过跳过冗余去噪步骤来加速生成,但现有方法依赖于粗粒度的块级跳过,无法捕获细粒度的像素动态。这种疏忽至关重要:高运动的像素需要更多的去噪步骤以防止错误累积,而静态像素则可以容忍剧烈的跳跃。我们通过将缓存错误与残余不稳定性联系起来,从理论上形式化了这一见解,并提出了 MotionCache,这是一种运动感知缓存框架,它利用帧间差异作为像素级运动特征的轻量级代理。 MotionCache 采用从粗到细的策略:初始预热阶段建立语义一致性,然后是运动加权缓存重用,动态调整每个词元的更新频率。对 SkyReels-V2 和 MAGI-1 等最先进模型的大量实验表明,MotionCache 分别实现了 $\textbf{6.28}\times$ 和 $\textbf{1.64}\times$ 的显着加速,同时有效地保持了生成质量(VBench:分别为 $1\%\downarrow$ 和 $0.01\%\downarrow$)。该代码可从 https://github.com/ywlq/MotionCache 获取。