论文

阅读重要内容:KV 缓存的查询自适应量化

Read What Matters: Query-Adaptive Quantization for KV Caches

模型推理模型优化推理加速KV Cache量化

摘要

KV 缓存条目在得知未来查询之前就已存储,但每个解码查询在不同位置都需要精度。我们使用保留位和每次查询获取的位的单独预算来研究这种不匹配。 ReadKV将每个键和值存储在渐进代码中,其前缀支持不同的重建精度。对于每个查询,它使用查询分配键通道前缀,根据重构的键计算注意力,然后使用该注意力分配值token前缀。存储的条目保持不变。每个阶段都在固定预算下优化校准失真目标;我们证明了精炼收益递减下的精确分配,并将这些目标与注意力输出误差联系起来。我们还展示了一个有限维注意力族,其中查询相关的访问在相同的读取预算下严格优于每个查询无关的读取器,即使使用不受限制的竞争编码器和解码器也是如此。在 6 个基本模型中,从 8 位缓存中平均读取 4 位,C4 困惑度最多增加 0.66%,大约使用四分之一 逻辑读取和 16 位缓存保留容量的一半。在相同的负载读取预算下,它始终比存储和完全读取四位更准确。保留比每次查询获取更多的位是为了长上下文解码,其中每步移动的缓存字节而不是权重决定成本。两个指令调整模型的长上下文问答和检索提供了额外的质量证据。在 NVIDIA A10G 上测试的 8K token、批量一、单层工作负载上,具有两位平均负载读取预算的受限八位 ReadKV 读取器的延迟比测试的 TurboQuant 编解码器低 39%。