论文

ART:注意运行时终止以实现高效 大语言模型 解码

ART: Attention Run-time Termination for Efficient Large Language Model Decoding

模型推理KV Cache

摘要

大语言模型 (LLM) 中的长上下文解码受到访问和处理键值 (KV) 缓存的成本的限制。尽管有证据表明注意力输出共同取决于键和值,但大多数现有的 KV 管理方法都依赖于仅键修剪,因为合并值会产生过高的开销。在本文中,我们提出了注意力运行时终止(ART),这是一种轻量级的运行时机制,它跟踪内核执行期间累积的注意力输出,并在进一步的贡献变得可以忽略不计时终止后续的 KV 块访问。 ART 不是取代 KV 选择,而是在现有的密集或稀疏注意力策略之上动态终止冗余 KV 遍历。我们引入了一种基于稳定性的标准,该标准监视中间注意力输出的幅度和方向变化,并提供所产生的截断误差的理论表征。 LongBench 和 RULER Needle-in-a-Haystack 任务的实验表明,ART 将现有 KV 缓存方法的生成吞吐量提高了 20%,且不影响结果质量。