论文

HISA:用于细粒度稀疏注意力的高效分层索引

HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention

模型推理推理加速

摘要

词元级 稀疏注意力机制,以 DeepSeek 稀疏注意力 (DSA) 为例,通过轻量级索引器对每个查询的每个历史键进行评分,然后仅在选定的子集上计算注意力,从而实现细粒度的键选择。虽然下游稀疏注意力本身可以很好地扩展,但索引器仍然必须扫描每个查询的整个前缀,从而引入了随着上下文长度而急剧增长的每层瓶颈。我们提出 HISA(分层索引稀疏注意力),这是索引器的即插即用替代品,它将搜索路径从平面词元扫描重写为两阶段分层过程:(1)块级粗略过滤阶段,对池化块表示进行评分以丢弃不相关区域,然后是(2)词元级 细化阶段,仅在保留的候选块内应用原始索引器。 HISA 保留下游稀疏 MLA 运算符使用的相同 词元级 顶部稀疏模式,并且不需要额外的训练。在内核级基准测试中,HISA 在 64K 环境下实现了最高加速。在大海捞针和LongBench上,我们直接用我们的HISA索引器替换DeepSeek-V3.2和GLM-5中的索引器,没有任何微调。 HISA 在质量上与原始 DSA 非常接近,同时大大优于块稀疏基线。