论文
预测、重用和修复:加速长上下文 LLM 解码的动态稀疏注意力
Predict, Reuse, and Repair: Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding
摘要
动态稀疏注意力 (DSA) 通过仅注意力与每个查询相关的前 K 个 KV 块来加速长上下文 LLM 解码,但它引入了序列化的选择到注意力的依赖关系,从而成为新的延迟瓶颈。我们提出了 PRR,一种推测-重用-修复运行时,它利用 DSA 选择中的时间局部性来预测可能的块,在选择过程中推测对它们的注意力,并在知道真正的选择集后逐步修复丢失的块。 PRR 使用基于 EMA 的轻量级预测器、分析引导的推测预算(使推测工作远离关键路径)以及基于 FlashAttention 的修复内核(使用在线 softmax 统计数据将丢失的块折叠到部分注意力状态)。在长上下文基准和代表性 DSA 方法中,PRR 将每个词元的解码延迟降低了 40%,同时保持了下游任务的准确性。 Github:https://github.com/Tianyu9748/Incremental_FlashAttention