论文

DFSAttn:用于高效视频生成的动态细粒度稀疏注意力

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

模型推理推理加速

摘要

Diffusion Transformer 在高质量视频生成方面取得了显着的成功,但由于注意力的二次复杂性,它们对时空 3D 全注意力的依赖会产生高昂的计算成本。块稀疏注意力是通过将计算集中在重要区域来缓解这种情况的常见方法。然而,DiT 中的注意力图表现出固有的动态和细粒度稀疏性,这导致现有的块稀疏注意力方法的质量显着下降,尤其是在高稀疏率下。在本文中,我们重新审视块稀疏注意力,并推导出注意力召回的理论下限,以表征控制其有效性的关键因素。在这些见解的指导下,我们提出了 DFSAttn,这是一种 无需训练 稀疏注意力框架,可以有效地实现动态、细粒度的稀疏化。 DFSAttn 包含三个核心设计:基于希尔伯特曲线的词元重新排序,以实现细粒度稀疏性,同时保持高效的 GPU 执行;分层块评分,用于准确的块重要性估计;以及具有自适应比率的稀疏掩码缓存,以平衡准确性和效率。实验结果表明,DFSAttn 在高稀疏性下始终优于现有方法,在保持高生成质量的同时实现高达 2.1$\times$ 的端到端加速。我们的代码是开源的,可在 https://github.com/jessica-hujie/DFSAttn 上获取。