论文
LoSA:块级扩散语言模型的局部感知稀疏注意力
LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models
摘要
分块扩散语言模型 (DLM) 以任意顺序生成多个标记,为自回归解码管道提供了一种有前途的替代方案。然而,在长上下文场景中,它们仍然受到内存限制注意力的瓶颈。由于 KV 膨胀问题,朴素稀疏注意力在 DLM 上失败,其中不同的查询选择不同的前缀位置,使得访问的 KV 页的并集很大。为了解决这个问题,我们观察到,在连续的去噪步骤之间,只有一小部分活跃词元表现出显着的隐藏状态变化,而大多数稳定词元几乎保持不变。基于这一见解,我们提出了 LOSA(局部感知稀疏注意力),它将缓存的前缀注意力结果重用于稳定词元,并仅将稀疏注意力应用于活动词元。这大大减少了必须加载的 KV 索引的数量,从而获得更高的加速比和更高的精度。在多个块级 DLM 和基准测试中,LOSA 保留了接近密集的准确性,同时显着提高了效率,在激进的稀疏水平下实现了高达 +9 点的平均准确性,同时保持了 1.54 倍的注意力密度。它还在 RTX A6000 GPU 上实现了高达 4.14 倍的注意力加速,证明了所提出方法的有效性。