论文
常数时间内的注意力:Vashista Sparse Attention 面向具有指数保证的长上下文解码
Attention in Constant Time: Vashista Sparse Attention for Long-Context Decoding with Exponential Guarantees
摘要
大型语言模型的大部分推理开销花费在对长上下文的注意力上,然而经验行为表明,对每个查询而言只有一小部分词元有实质性贡献。我们通过将注意力建模为向键向量凸包的投影并分析其熵(softmax 类)松弛来形式化这一现象。我们的主要理论贡献是一个面稳定性定理,它表明在严格互补余量(由 KKT 乘子认证的支持间隙 Δ)条件下,熵注意力集中于常数大小的活动面:分配给非活动词元的总质量按 exp(-Ω(Δ/ε)) 指数衰减,而活动面上的误差随温度/正则化参数 ε 线性伸缩。这为稀疏长上下文解码何时安全提供了实用判据,并提供了以精度换算力的有原则的调节旋钮。基于这些保证,我们提出 Vashista Sparse Attention,这是一种即插即用机制,通过与现代推理栈兼容的分页式上下文选择策略为每个查询维护一个小的候选集。在长上下文评估中,我们观察到稳定的常数大小有效支撑、显著的挂钟时间加速,以及在支持间隙诊断所预测的范围内极小的质量退化。最后,我们讨论了对隐私敏感与物理隔离(air-gapped)环境的部署意义:可互换的注意力模块能够在不依赖外部检索的情况下实现可预测的延迟与成本。