论文
BeaconKV:信标查询引导的键值缓存压缩,用于高效的大型推理模型推理
BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference
摘要
大型推理模型 (LRM) 通过扩展思想链 (CoT) 生成实现卓越的问题解决能力,但生成的键值 (KV) 缓存随序列长度线性增长,并产生严重的内存瓶颈,通常超出长推理跟踪的 GPU 容量。现有的 KV 缓存压缩方法依赖于最近的查询来估计未来词元的重要性,隐含地假设这些作为未来注意力模式的可靠代理。我们证明了这种假设在长视野推理中是失败的:某些解码步骤会生成重新考虑遥远的先前上下文的思想重访词元(TRT),例如在跟踪早期制定的任务解决计划。通过系统分析,我们发现TRT簇对应的查询在嵌入空间中分成了少量的相似组。基于这一见解,我们提出了 BeaconKV,一种 无需训练 KV 缓存压缩方法,用于维护信标查询、每个全局查询集群的紧凑代表,以预测哪些 KV 对将被重新访问,而无需存储整个查询历史记录。在四个开源 LRM 和不同的推理基准测试中,BeaconKV 的性能普遍优于现有的压缩方法,可减少高达 5.8 美元的内存,同时几乎保持完整的缓存精度,并将吞吐量提高超过 4.3 美元。