论文
无需训练 基于累积能量过滤的稀疏注意力
Training-free sparse attention based on cumulative energy filtering
摘要
稀疏注意力通过仅计算重要的标记而跳过其余标记,加速视频生成的扩散 Transformer (DiTs)。词元选择策略是平衡稀疏性和准确性的关键。我们将词元过滤过程制定为双目标优化问题:最大化稀疏性和最小化准确性下降。现有算法无法同时实现这两个目标。例如,Top-p 只考虑精度约束,而 Top-k 保持固定的计算预算但放松了精度约束。本文证明,维持固定的召回率足以确保准确性,而固定的阈值对于降低计算成本来说并不是最佳选择。因此,我们提出了一种动态阈值方案来提高稀疏性,同时保持相同的精度水平。此外,我们的算法与 Flash Attention (FA) 深度集成,无需任何额外的掩蔽计算开销。 Wan 2.2 上的实验结果验证,与同样与 FA 集成的 BLASST 算法相比,我们的动态阈值策略将稀疏性从 61.42% 提高到 82%,VBench 指标下降不到 5%。这导致注意力计算量增加了大约 15\%,计算效率提高了 $1.61\times$,比 BLASST 高出 1.18 倍。