论文
MC-Sparse:解构和缩小扩散变压器中的密集稀疏注意力差距
MC-Sparse: Deconstructing and Closing the Dense-Sparse Attention Gap in Diffusion Transformers
摘要
稀疏注意力是减少长序列生成任务(例如视频和高分辨率 3D 资产生成)中扩散变压器延迟的主要方法。然而,现有方法可能会降低高稀疏水平下的生成质量和保真度。通过受控预言机比较,我们将这种退化追溯到三个来源:token分组施加的约束、不准确的交互选择以及丢弃token时注意力贡献的损失。在此分析的指导下,我们提出了元缓存稀疏注意力(MC-Sparse),这是一个无需训练框架,它选择单独的键值(KV)token,同时将类似的查询组织到瓦片对齐的组中,以实现高效的 GPU 执行。 MC-Sparse 缓存包含查询组、使用精确注意概率选择的 KV 索引以及密集和稀疏注意输出之间的残差的元数据,并在后续的去噪步骤中重用它们。在视频和 3D 生成模型中,MC-Sparse 比现有的稀疏注意力基线实现了更高的密集注意力输出保真度和更大的去噪加速,且没有明显的质量下降。相对于密集注意力,它在 Minimax-H3-Base 上提供了 $1.80\times$ 去噪加速,在 3D 资产生成上提供了 $2.32\times$ 加速,两者的质量损失都可以忽略不计。
