论文
DistillCache:KL 引导的自适应 KV 缓存逐出,实现内存高效的 LLM 推理
DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference
摘要
基于 Transformer 的 大语言模型 (LLM) 在许多任务中实现了强大的性能,但其键值 (KV) 缓存随序列长度线性增长,为长上下文推理造成严重的内存瓶颈。现有的启发式驱逐方法(例如 H$_2$O 和 SnapKV)依赖于静态注意力或位置信号,这些信号通常无法捕获词元的未来预测影响。我们提出了 DistillCache,这是一个强化学习框架,它将 KV 缓存驱逐制定为顺序决策问题。 DistillCache 使用丰富的内部模型信号(注意力统计、价值范数、熵和位置)学习轻量级策略网络,并通过每步 KL 散度奖励使用 REINFORCE 对其进行训练,以保留全缓存输出分布。在 7B 参数指令调整的 Transformer (Mistral-7B-Instruct-v0.3) 上,DistillCache 在 LongBench 上以 25% 的缓存预算保留了 94.2% 的全缓存精度,比强启发式基线(H$_2$O、SnapKV)高出多达 2.7 个绝对点,并且在我们的重新实现下,基于并发 RL 的方法(ForesightKV、RLKV)在长上下文任务上最多提高 1.4 分。在推理基准测试中,DistillCache 与最佳并发方法具有竞争力,并在积极压缩下超越了它。它还提供高达 2.1 倍的全缓存吞吐量,同时保持具有竞争力的实际效率。这些结果凸显了学习的、分布感知的策略对于内存高效的长上下文 LLM 推理的有效性。