论文

KVpop——具有预测性在线修剪的键值缓存压缩

KVpop -- Key-Value Cache Compression with Predictive Online Pruning

模型推理KV Cache

摘要

键值 (KV) 缓存增长是自回归解码的主要瓶颈,因为内存和带宽随上下文长度线性扩展。现有的 KV 驱逐方法通常依赖于静态启发式或代理分数,这很难跟踪未来的词元效用,并会在相关性发生变化时导致脆弱的驱逐。为了解决这个问题,我们引入了 KVpop,它通过直接监督保留或删除决策来学习固定预算的 KV 驱逐策略。评分器针对一个新颖的未来注意力目标进行训练,该目标可以在不具体化密集注意力图的情况下进行有效计算。我们进一步引入了一种基于延迟记忆的评分器,它在学习驱逐方法中是独一无二的,它推迟了固定数量的步骤的评分,以利用近期的上下文。在 AIME 和 HMMT 数学推理上,KVpop 在 Qwen3-4B 上在 75% KV 缓存压缩时保留了 98% 的全注意力性能,在 88% 压缩时保留了 97%,始终优于既定的驱逐基线。 Qwen3-8B 显示出更强的结果,达到了接近满分的教师表现。这些结果表明,使用未来注意力信号来监督驱逐可以在保持质量的同时降低内存成本。