论文

MAC-Attention:一种快速准确的注意力计算的匹配修正完整方案

MAC-Attention: a Match-Amend-Complete Scheme for Fast and Accurate Attention Computation

模型推理KV Cache

摘要

LLM 中的长上下文解码是 IO 绑定的:每个词元都会重新读取不断增长的 KV 缓存。先前的加速通过压缩来削减字节,从而降低保真度,或者通过选择/驱逐来限制仍然可访问的内容,并且两者都会降低延迟召回和长格式生成的性能。我们引入了 MAC-Attention,这是一种保真度和访问保留的替代方案,它通过对语义相似的最近查询重用先前的注意计算来加速解码。它从匹配阶段开始,在短本地窗口上执行 RoPE 前 L2 匹配;修正阶段通过重新计算匹配边界附近的小带来纠正重用的注意力;完整的阶段通过数值稳定的合并将校正结果与 KV 尾部计算的新注意力融合在一起。在匹配命中时,无论上下文长度如何,计算和带宽复杂性都是恒定的。该方法与模型无关,由 IO 感知内核、分页 KV 管理器和 MQA/GQA 组成。在 LongBench v2 (120K)、RULER (120K) 和 LongGenBench(16K 连续生成)中,与最新的 FlashInfer 库相比,MAC-Attention 将 KV 访问减少了高达 99%,在 128K 时将词元生成延迟减少了 60% 以上,并实现了超过 14.3 倍的注意力阶段加速,高达 2.6 倍的端到端加速,同时保持了完全注意力的质量。通过重用计算,MAC-Attention 可提供快速且可靠的长上下文推理。代码可在此处获取:https://github.com/YJHMITWEB/MAC-Attention.git