论文

LatentIndex:跨层共享和针对稀疏注意力的特定层选择

LatentIndex: Cross-Layer Sharing with Layer-Specific Selection for Sparse Attention

模型推理KV Cache

摘要

稀疏注意力减少了核心注意力计算,但其索引器仍然会产生重复的选择工作和每层键缓存存储。跨层重用选定的索引可以减少此开销,但会将多个层限制为相同的token集。我们引入 LatentIndex,它扩展了跨索引器层的多头潜在注意力的潜在共享原理。每个层组从其第一层的隐藏状态构建一个共享的潜在缓存,而特定于层的评分可以实现独立的token选择。将密钥解码器吸收到查询中可以直接对共享缓存进行评分,而无需重建历史每层密钥。我们开发了无需训练校准,并研究了该原理的训练感知实例。为了平衡质量和计算,分层选择(HS)变体让追随者独立地完善锚点提出的共享候选集。通过四层共享,LatentIndex 在 DeepSeek-V3.2 上将逻辑索引器缓存存储减少了 61.1%。在 DeepSeek-V3.2 和 GLM-5 中,无需训练 LatentIndex 比 IndexCache 提高了召回率的头部注意力质量高达 3.28 个百分点,同时保持 RULER 和 LongBench 性能接近原生 DSA。与 DSA 相比,HS 在 8K-128K 上下文中进一步实现了 2.30-2.72 倍的解码索引器加速,保留了 LatentIndex 的召回率的大部分内容。 LatentIndex 提供了跨层索引的新视角:共享连续表示而不是离散选择可以实现高效重用,同时保留特定于层的token选择。

LatentIndex:跨层共享和针对稀疏注意力的特定层选择的原论文方法或结果图
图 1:DSA 使用每层索引器密钥缓存和token选择; IndexCache 重用锚点的选择(橙色虚线路径)。 LatentIndex 共享一个源自锚点隐藏状态的潜在缓存,并且特定于层的解码器定义特定于层的键。在推理时,解码器被吸收到直接缓存评分和独立token选择的查询中,而不重建历史密钥。查询是特定于层的,但为了视觉清晰起见仅显示一次。