论文
LoSA:无需训练 视频扩散加速的近无损稀疏注意力
LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration
摘要
视频扩散 Transformer 的采样成本很高:每个去噪步骤都在长 3D 标记序列上应用自注意力,随着分辨率和持续时间的增长,二次成本占主导地位。稀疏注意力可以在不进行再训练的情况下降低这种成本,但现有方法追求激进的稀疏性,进一步加速会不成比例地增加注意力保真度。我们的目标是这种权衡的另一端:通过构造修复近乎无损的保真度,并在该约束允许的情况下删除尽可能多的计算。两个观察结果使该机制变得实用:大约 40% 的块交互可以被删除,同时保留 99% 的注意力质量,并且高质量支持在去噪步骤中保持稳定。我们提出了 LoSA,一种 无需训练 稀疏注意力方法,它将保留质量阈值固定为 99%,而不是稀疏率:它在一个早期密集步骤中测量精确的块注意力质量,为每个头和查询块保留满足阈值的最小键/值块集,并为所有剩余步骤重用冻结的块索引。在 Wan2.1-1.3B 上,仅 LoSA 就提供了 1.36 美元\times$ 的加速,而 VBench 总体下降了 0.06 点。组合方面的好处最大:与特征缓存相结合,LoSA 在 HunyuanVideo 上实现了 $3.2\times$ 加速,但下降了 0.02 点,而在同等速度下最强稀疏基线的加速为 0.32 点。在三个视频扩散 Transformer 和高达 $3.2\times$ 的加速中,LoSA 始终实现了最佳的 无需训练 速度与质量权衡。