论文
混合转换器:跨异构 大语言模型 转换 KV 缓存
Mixture-of-Translators: Translating KV Caches Across Heterogeneous Large Language Models
摘要
异构 大语言模型 (LLM) 系统越来越依赖于共享上下文、检索的证据和多代理对话历史,但其内部键值 (KV) 缓存仍然特定于模型,并且无法跨架构重用。因此,每个模型必须重复预填充或存储相同上下文的缓存,限制了多模型推理和长上下文生成的可扩展性。我们提出了 Mixture-of-Translators(MoT),这是一种缓存翻译框架,它将上下文 KV 缓存从源 LLM 映射到目标 LLM 的缓存空间。与依赖于单个投影路径或全局共享潜在空间的先前方法不同,MoT 使用多个转换器模块来捕获不同的源-目标映射。为了进一步减少残余平移误差,我们引入了上下文校正损失,将重放的目标轨迹与本机目标轨迹对齐。我们揭示了缓存转换中的两种相互竞争的故障模式:从早期注入的传播转换转移和从后期注入的最后状态转移。 MoT 通过翻译器混合和目标端校正来解决这些问题。在 Qwen2.5、GPT-2 和 OPT 模型之间的同构和异构翻译中,MoT 保留了下游 QA 性能,包括 Qwen2.5-7B 规模的翻译,平均闭集 QA 准确度为 51.0%,平均提取 QA F1 为 0.43。在实际案例研究中,MoT 能够实现多智能体推理的质量保持内存重用,并在长上下文缓存增强生成中保留 96.3% 的直接上下文质量,展示了跨异构 LLM 的可扩展 KV 缓存重用。