论文

通过块近似稀疏注意力在扩散语言模型中进行高效的长上下文建模

Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

模型推理推理加速

摘要

扩散语言模型 (DLM) 可实现全局连贯、双向且可控的文本生成,与传统自回归 LLM 相比具有优势,但扩展到超长序列的成本仍然很高。许多现有的块稀疏注意力方法通过高分辨率注意力空间上的固定采样模式来选择块,例如尾部区域或反对角条纹。这种先验驱动的采样可能会错过显着的标记,并在分布变化下引入不稳定。在本文中,我们提出了具有分块预下采样操作的块近似稀疏注意力框架(BA-Att),该框架可识别紧凑下采样空间内的信息区域,避免对脆弱的位置先验的依赖。为了分析其理论行为,我们定义了一个预言机后下采样注意力图,并形式化了前下采样方案和后下采样方案之间的近似误差。基于这一见解,我们引入了轻量级范数排序模块和协方差补偿校正,该校正使用对角线 QK 方差近似完全协方差,从而降低了计算复杂性。大量实验表明,我们的算子在注意力计算方面比 FlashAttention 实现了高达 6.95 倍的加速,并且在语言模型、多模态语言模型和视频生成模型上保持了 50% 稀疏度下接近全注意力的性能,展示了强大的效率和泛化能力。