论文
用于跨模型 KV 共享的通用上下文重用层
A Universal Context-Reuse Layer for Cross-Model KV Sharing
摘要
现代 大语言模型 (LLM) 服务系统越来越多地在重复或共享上下文中运行,但每个模型通常都会执行自己的预填充计算,即使另一个模型已经处理了相同的输入。现有的 KV 缓存重用机制大大减少了单个模型内的冗余计算,但通常假设缓存的生产者和消费者是相同的。我们研究 \emph{跨模型 KV 共享},它将源模型产生的 KV 状态转换为可由不同目标模型使用的表示,包括规模、架构、注意力配置、分词器和模型系列不同的模型。我们在家庭内部和跨家庭环境中评估该方法。对于 Qwen2.5-7B $\rightarrow$ Qwen2.5-1.5B,转换后的 KV 状态将 LongBench2 精度从 27.59% 提高到 34.48%,比原生 1.5B 基线提高了 6.89 个百分点,同时相对于原生目标预填充降低了切换成本。对于跨系列 Qwen2.5-1.5B $\rightarrow$ Gemma-2-2B 设置,KV 切换在 4K 上下文长度下将目标端预填充成本降低高达 67.05\%,同时保持接近本机模型基线的解码复杂度。在更加异构的 Llama3.1-70B $\rightarrow$ Qwen2.5-7B 设置中,跨系列切换的准确度达到 44.0\%,而本机 Qwen2.5-7B 推理的准确度为 45.7\%,同时将测量的延迟从 899ms 减少到 138ms。这些结果提供了初步证据,表明 KV 状态可以用作可转移的计算表示,而不是严格的模型本地缓存,并激发 \emph{上下文移动性} 作为系统抽象,以减少异构 LLM 和多智能体推理工作流程中的冗余预填充。