论文

一个阈值是不够的:视频传播的即时不变缓存时间表

One Threshold Is Not Enough: Prompt-Invariant Caching Schedules for Video Diffusion

模型推理推理加速

摘要

视频扩散模型仍然很昂贵,因为去噪会反复评估昂贵的模型主干。 TeaCache、EasyCache 和 DiCache 等动态缓存方法通过重用先前的输出来降低此成本,同时累积的漂移信号保持在阈值 $τ$ 以下。尽管现有方法改善了漂移信号,但它们在整个去噪过程中保持 $τ$ 固定。我们表明,固定阈值在结构上是次优的:在去噪过程中改变 $τ$ 可以实现质量与延迟之间的权衡,这是在具有不同漂移信号的三种缓存方法中任何固定阈值都无法实现的。我们进一步表明,令人惊讶的是,每种方法的漂移轨迹在七种方法模型组合中几乎是即时不变的。漂移轨迹的形状由模型和缓存方法决定;因此,阈值计划可以离线校准并在各代之间重复使用。基于这些发现,我们提出了 ACID(视频生成自适应缓存),它在漂移快速变化的关键区域使用低阈值,在稳定区域使用高阈值。 ACID 根据漂移信号的二阶导数离线识别这些区域,不需要训练,并且增加的运行时间开销可以忽略不计。在 HunyuanVideo、Wan 2.1 和 CogVideoX 上的 TeaCache、EasyCache 和 DiCache 中,ACID 将速度质量 Pareto 前沿推到了固定阈值之外。在采用 HunyuanVideo 的 TeaCache 上,它比无缓存实现了 2.16 倍的加速,比保守的固定阈值实现了 38% 的额外加速,相对于固定阈值配置,PSNR、SSIM 和 LPIPS 降级低于 0.3 dB、0.01 SSIM 和 0.01 LPIPS。