论文

用于长推理的信息感知 KV 缓存压缩

Information-Aware KV Cache Compression for Long Reasoning

模型推理KV Cache

摘要

大语言模型 (LLM) 的推理能力快速提升,导致预填充和解码阶段的键值 (KV) 缓存大小不断增加。现有的KV缓存压缩方法主要依靠注意力权重来估计token重要性。虽然注意力有效地捕捉了上下文相关性,但它忽略了与预测不确定性和词元信息性相关的补充信息理论信号。在本文中,我们从前瞻性的角度重新审视词元的重要性,并引入 \textit{Forward Influence},一个衡量压缩词元如何影响未来上下文的指标。我们的分析表明,通过注意力分数选择的标记主要影响附近的上下文,而与高预测不确定性相关的标记对遥远的未来上下文表现出更强的影响。基于观察,我们提出 \textbf{InfoKV},一种结合信息论信号的熵感知 KV 缓存压缩框架。它将 词元级 预测不确定性与分层表示演化相结合,并在推理过程中将所得的熵分数与注意力分数相结合。使用 Llama-3.1、Llama-3.2 和 DeepSeek-R1 进行的长上下文推理基准测试表明,InfoKV 在长预填充和解码场景中始终优于现有的基于注意力的 KV 压缩方法。