论文
CacheBridge:高效跨模型KV缓存迁移
CacheBridge: Efficient Cross-Model KV Cache Transfer
摘要
在多模型系统中的 LLM 之间共享上下文需要接收模型预先填充共享前缀,因为 KV 缓存是特定于模型的。最近的封闭式跨模型 KV 传输(以下简称全头映射)通过从源缓存到目标缓存拟合免训练仿射映射器来避免这种重放。然而,其全头设计映射来自所选层中每个源 KV 头的每个目标 KV 头,使得传输质量对架构差异敏感,并导致映射器存储和应用程序成本随着层支持而增长。为此,我们引入了 CacheBridge,它共同设计了架构索引映射器支持、注意力对齐校准和有界映射器构造,同时保留了用于在线部署的封闭式仿射接口。 CacheBridge 将每个目标头限制为匹配的源头,通过因果注意敏感性对重建误差进行加权,并使用融合的 GPU 内核来构造加权的足够统计数据,而无需具体化完整的观察张量。在三个传输方向上,CacheBridge 恢复了两个 Ministral 3 传输方向,其中全头映射失去了很大的准确性,同时在 Qwen3 上保留了 99.83% 的平均目标保留率。在 Qwen3 $14\mathrm{B}\to32\mathrm{B}$ 上,它减少了映射器存储 $8\times$,将应用程序加速高达 $3.0\times$,将 \fullhead 与十分之一的校准数据相匹配,并将 500 序列构建从 92.63 秒减少到 8.63 秒 ($10.7\times$)。