论文

在广度上花费字节:长链思维推理中解码时 KV 压缩的精度计数权衡

Spend Bytes on Breadth: Precision-Count Trade-offs for Decode-Time KV Compression in Long Chain-of-Thought Reasoning

模型推理KV Cache

摘要

推理模型在解码长思维链 (CoT) 时写入大部分 KV 缓存,因此必须在固定的记忆预算下在线压缩缓存。解码时方法主要决定要驱逐哪个token。我们询问固定字节预算应该如何在缓存的token和精度的数量之间分配。 BreadthKV 在较低的精度上将字节花费在更多的token上,将量化与驱逐相结合,并通过 60 个问题端到端校准为每个模型和预算选择位宽,因为离线注意力误差无法可靠地预测它。在三个推理模型和四个数学和科学基准上,它在 18 个设置中的 17 个设置中得分高于逐出,并且产生较短的输出。驱逐损失的大部分来自脱轨运行,这种运行一直推理到长度上限而没有得出答案。在 Qwen3-8B 上,在我们最紧张的预算下,驱逐将 91% 的 AIME 样本发送到上限,BreadthKV 发送到 40%。在同一协议下,BreadthKV 在统计上与联合率失真分配器 (RDKV) 没有什么区别,后者使用的 KV 记忆时间多了 27%,并且它的性能优于我们重新实现的 ThinKV。