论文

LVSA:无需训练 长视频扩散的稀疏注意力

LVSA: Training-Free Sparse Attention for Long Video Diffusion

模型推理推理加速

摘要

密集自注意力是长视频扩散推理的计算和质量瓶颈:成本随着序列长度呈二次方增长,并且超出训练范围,模型收敛到近静态输出,即“冻结”重复视频。最先进的方法要么成本太高,例如,它们需要重新训练,要么无法以可扩展的方式满足性能和质量目标。为此,我们引入了长视频稀疏注意力(LVSA),这是一种用于视频扩散的与 无需训练 模型无关的块稀疏注意力 Transformer,它将结构化窗口模式与旋转全局锚点相结合,从而消除了导致长程时间伪影的固定网格偏差。与密集注意力相比,LVSA 与 FlashInfer 内核相结合,在 6 倍水平线的 Wan 2.1 1.3B 上将计算量减少了 3.17 倍,在 6 倍水平线的 Wan 2.1 14B 上减少了 2.98 倍,在 1.5 倍水平线的 HunyuanVideo 1.5 上减少了 3.33 倍。除了减少计算量之外,LVSA 还能够在 2 倍水平上生成 HunyuanVideo 1.5,否则在单个 GPU 上会出现内存不足的情况。此外,与 RIFLEx 相比,LVSA 在 Wan 2.1 1.3B 上的加速速度高达 2.41 倍,与 UltraViCo 相比高达 3.27 倍。为了证明跨不同平台的适用性,我们在 NPU 上应用了 LVSA,与密集注意力相比,在 Wan 2.2 A14B 上实现了高达 2.71 倍的加速,在 Wan 2.1 1.3B 上实现了 3.24 倍的加速。为了以公平的方式评估质量,我们引入了 VQeval,这是一种对循环视频失败进行正确评分的工具,这些工具会在 VBench-Long 等最先进的评估器中获得奖励。 LVSA 在训练水平长度上的生成是质量中性的,在扩展长度上是质量正的。