论文

RaReCache:按秩分歧选择性重算跨模型KV Cache

RaReCache: Bridging the Gap in Cross-Model KV Cache Reuse via Rank disagreement-based Selective Recomputation

模型推理AI 基础设施KV Cache推理服务

摘要

跨模型KV缓存复用仍是现代LLM服务的一项难题。编程Agent和多模型系统越来越常把共享上下文交给不同模型:用户可能在会话中途切换模型,也可能由级联系统把困难查询升级到更强模型。由于KV缓存包含模型特有的表示,每次切换通常都迫使接收模型从零预填充整个上下文。近期研究表明,闭式线性映射能在同一家族内转换KV缓存,但模型规模差距越大,迁移准确性越低。本文发现,这些迁移失败集中于少量信息密集的token。我们提出RaReCache,通过选择性重算,让较大的目标模型从小得多的源模型预填充的缓存中准确解码。RaReCache采用新的秩差异度量识别关键位置:根据映射后的KV在校准数据支持较弱的输出方向上的能量,为每个token评分。我们在两个模型家族、五项基准上实验。在Qwen3-0.6B到14B这一约23倍参数差距下,重算30%的位置可保留目标模型95%—99%的准确率;在Llama3-8B到70B这一约8.8倍差距下,重算40%可保留96.5%的目标准确率。RaReCache大幅降低对源模型规模的敏感性,预填充最多加速3.04倍。在线服务中,其单GPU请求吞吐量为目标模型完整预填充的1.8倍;在目标模型达到饱和的负载下,以30%的重算预算,将首token时间(TTFT)的中位数和第99百分位分别缩短5.0倍和6.4倍。该框架让小模型代替大型目标模型进行预填充,目标模型只重算关键token,从而显著降低预填充延迟。