论文

通过统一信息理论目标重新思考 KV 缓存驱逐

Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective

模型推理KV Cache

摘要

键值 (KV) 缓存对于 大语言模型 推理至关重要,但其内存开销给长上下文生成带来了关键瓶颈。现有的驱逐政策主要依赖于经验启发法,缺乏严格的理论基础。这项工作通过信息瓶颈原理的视角重新思考了 KV 缓存驱逐。在线性高斯注意力代理下,我们推导了一个封闭形式的互信息目标,该目标描述了保留的 KV 缓存子集的有效信息容量。这一表述表明,现有的各种驱逐策略可以解释为同一容量最大化原则的不同近似。在这一见解的指导下,我们引入了 CapKV,这是一种容量感知驱逐方法,它通过使用统计杠杆分数的对数行列式近似直接以信息保存为目标。这种方法用保留最大预测信号的理论基础机制取代了启发式选择。跨多个模型和长上下文基准的大量实验表明,CapKV 始终优于先前的方法,在内存效率和分代保真度之间实现了更好的权衡。我们的代码可在 https://github.com/jiamingyy/CapKV 获取