论文

KVBoost:面向高效LLM推理的块级KV缓存复用与偏差引导重算

KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference

模型推理KV Cache

摘要

基于Transformer的大语言模型(LLM)预填充延迟高,因为每个请求都必须重算键值(KV)张量。现有前缀缓存系统降低了这一成本,但要求提示共享开头连续前缀,当共享内容出现在任意位置时效果受限。我们提出KVBoost,一个面向HuggingFace兼容解码器模型的块级KV缓存复用系统,无论内容位置如何都能复用。KVBoost引入双哈希键控方案,把位置身份(前缀哈希)与内容身份(内容哈希)分离,支持精确与近似缓存匹配。为解决独立缓存块带来的注意力边界误差,KVBoost采用两种修复策略:SelectiveRecompute重编码边界区域,CacheBlendRecompute在探测遍后识别并重算高偏差token。系统还纳入非对称KV量化(int8/int4)、自适应块边界切分以及固定内存预算下的重要性加权淘汰。在Qwen/Qwen2.5-3B上、1,000个bug定位样本上的评估显示,KVBoost把首token时间降低4.49倍(142.4毫秒对比639.1毫秒),比前缀缓存好16%,且无精度损失(99.2%对比99.1%)。KVBoost提供了一个实用、内存有界的推理加速层,兼容基于RoPE的模型且无需架构修改。

KVBoost:面向高效LLM推理的块级KV缓存复用与偏差引导重算:论文配图
图2:KVBoost 的逐样本精确匹配准确率与KV缓存复用率的关系。在整个复用率范围内准确率保持在98%及以上,证实接缝修复即使在高速存复用下也能保持输出质量。