论文
MISA:用于长上下文 LLM 推理的索引器稀疏注意力的混合
MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference
摘要
DeepSeek 稀疏注意力 (DSA) 通过引入学习型标记索引器,对每个前缀标记进行评分并选择最相关的标记作为主要注意力,从而为细粒度推理时间稀疏注意设置了最先进的技术。为了保持表达能力,索引器使用许多共享相同选定标记集的查询头(例如 DeepSeek-V3.2 上的 64 个);这种多头设计正是使索引器成为长上下文中的主要成本的原因。我们提出 MISA(索引器稀疏注意力混合),它是 DSA 索引器的直接替代品,它将其索引器头视为专家混合池。轻量级路由器使用廉价的块级统计数据来选择仅少数活动头的查询相关子集,并且只有这些头运行繁重的 词元级 评分。这保留了原始索引器池的多样性,同时降低了每次查询的成本,从使用每个头对每个前缀词元进行评分,到仅使用少数路由头进行评分,再加上在一小部分池键上计算的可忽略不计的路由器项。我们进一步介绍了 MISA 的分层变体,它使用路由传递来保留扩大的候选集,然后使用原始 DSA 索引器对其进行重新排序,以几乎准确地恢复最终选定的标记。只需 8 个活动头且无需额外训练,MISA 就可以在 DeepSeek-V3.2 和 GLM-5 上与 LongBench 上的密集 DSA 索引器相匹配,同时运行时索引器头数分别减少八倍和四倍,并且平均性能优于 HISA。它还保留高达 128K 词元上下文的完全绿色的大海捞针热图,并恢复 DSA 索引器每层选择的 92% 以上的词元。我们的 TileLang 内核在单个 NVIDIA H200 GPU 上的速度比 DSA 原始索引器内核大约提高 3.82 倍。