论文
您只需索引一次:具有共享路由的跨层稀疏注意力
You Only Index Once: Cross-Layer Sparse Attention with Shared Routing
摘要
现代 LLM 中的长上下文推理越来越受到解码效率的限制,尤其是在模型生成长中间思想链的推理繁重的环境中。现有的稀疏注意力方法经常面临实际的效率与质量的权衡。结构化块稀疏方法通常提供更强的加速,但会导致明显的质量损失,而词元稀疏方法通常更准确,但提供有限的端到端加速,因为整个缓存上的 top-k 路由仍然昂贵。在这项工作中,我们提出了跨层稀疏注意力(CLSA),它建立在 YOCO 等 KV 共享架构之上。核心思想是不仅跨跨解码器层共享KV缓存,而且还共享路由索引。单个索引器计算 词元级 top-k 选择一次,并跨层重用生成的索引,从而保留词元稀疏注意力的细粒度选择性,同时分摊路由开销。由此产生的架构联合改善了所有主要推理瓶颈,包括预填充、KV 缓存存储和长上下文解码。短上下文和长上下文基准测试表明,CLSA 既准确又高效,在 128K 上下文下实现了高达 7.6 倍的解码加速和 17.1 倍的整体吞吐量改进。这些结果为长上下文 LLM 提出了更完整的架构解决方案,共同提高了模型质量和推理效率。