论文

PIVOT:词元级 稀疏注意力的高效查询组索引

PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention

模型推理推理加速

摘要

词元级 稀疏注意力由 DeepSeek 稀疏注意力 (DSA) 在生产系统中实现,使下游注意力变得高效,但将瓶颈转移到为其提供数据的索引器。要为每个查询选择前 k 个标记,索引器仍然必须对每个前面的标记进行评分,对于长度为 L 的序列,每层都会产生 O(L^2) 的成本。我们观察到,每个查询的扫描很大程度上是多余的:附近的查询选择高度重叠的前 k 个标记,并且索引器分数沿着键轴是长尾的。我们在 PIVOT(通过一个完整前缀遍历进行代理索引)中利用这些属性,无需训练 是 DSA 索引器的直接替代品,在一组附近的查询中共享一个前缀扫描。 PIVOT 将一组聚合为单个代理查询,执行一次共享全前缀扫描以获得候选集,然后从该集中为每个查询选择一个 top-k。两种变体以速度换取保真度:PIVOT-Reuse 在整个组中共享代理 top-k 以获得最大速度,而 PIVOT-Refine 使用每个查询的索引器对候选集重新评分,然后选择一个单独的 top-k,以较小的额外成本匹配密集索引器。单个算法涵盖两个推理阶段,区别仅在于组的形成方式:预填充中的固定大小的连续查询组,以及解码中的一个多词元预测 (MTP) 步骤中一起解码的查询。在跨 LongBench 和 RULER 的 DeepSeek-V3.2 和 GLM-5.1 上,PIVOT 与密集 DSA 索引器的准确性相匹配,同时在长上下文中将其加速最多 4 倍,并将端到端延迟减少最多 1.6 倍。