论文

LLM 系列中的跨模型 KV 缓存传输:用于预填充重用的闭式线性映射

Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse

模型推理KV Cache

摘要

生产部署经常在一个系列中的不同规模模型之间进行交换,以实现成本质量级联、会话中切换和路由,并且每次交换都会迫使接收器从头开始偿还预填充。我们提出跨模型 KV 缓存传输,其中接收器重用源的 KV 缓存,跳过预填充。我们发现跨模型 KV 在匹配的 KV 对之间具有显着的线性结构,其中源和目标共享 KV 头数和每头尺寸。在 Qwen3 14B->32B 上,一个源层解释了目标键中 56% 的方差和值中的 32%,在多个源层中上升到 79% 和 65%。在此基础上,我们设计了一种封闭式山脊映射器,该映射器按头操作并分三个步骤进行。首先,对于每个目标层,我们选择前 k 个最具预测性的源层并将它们的 KV 连接起来作为输入。其次,我们在映射之前从键中剥离 RoPE,因此拟合是无位置的并且可以跨上下文长度重用。第三,我们在一个小型校准集上拟合岭回归,该校准集包含 500 个 FineWeb-Edu 序列,每个序列有 1,024 个标记。令人惊讶的是,在三个系列的六对中,该线性映射器在四对上保留了 73-98% 的接收器独立预填充精度,而其中两对急剧下降。非线性 MLP 在故障时恢复高达 +37 pp HellaSwag 保留。映射器的运行速度比重新预填充快 2.7-25 倍,并且在多轮切换中保持稳定,使跨模型 KV 缓存传输变得实用。