论文
LatentIndex:跨层共享和针对稀疏注意力的特定层选择
LatentIndex: Cross-Layer Sharing with Layer-Specific Selection for Sparse Attention
摘要
稀疏注意力减少了核心注意力计算,但其索引器仍然会产生重复的选择工作和每层键缓存存储。跨层重用选定的索引可以减少此开销,但会将多个层限制为相同的token集。我们引入 LatentIndex,它扩展了跨索引器层的多头潜在注意力的潜在共享原理。每个层组从其第一层的隐藏状态构建一个共享的潜在缓存,而特定于层的评分可以实现独立的token选择。将密钥解码器吸收到查询中可以直接对共享缓存进行评分,而无需重建历史每层密钥。我们开发了无需训练校准,并研究了该原理的训练感知实例。为了平衡质量和计算,分层选择(HS)变体让追随者独立地完善锚点提出的共享候选集。通过四层共享,LatentIndex 在 DeepSeek-V3.2 上将逻辑索引器缓存存储减少了 61.1%。在 DeepSeek-V3.2 和 GLM-5 中,无需训练 LatentIndex 比 IndexCache 提高了召回率的头部注意力质量高达 3.28 个百分点,同时保持 RULER 和 LongBench 性能接近原生 DSA。与 DSA 相比,HS 在 8K-128K 上下文中进一步实现了 2.30-2.72 倍的解码索引器加速,保留了 LatentIndex 的召回率的大部分内容。 LatentIndex 提供了跨层索引的新视角:共享连续表示而不是离散选择可以实现高效重用,同时保留特定于层的token选择。
