论文

潜在缓存流:无文本的模型到模型通信

Latent Cache Flow: Model-to-Model Communication Without Text

智能体系统模型推理KV CacheAgent 协作

摘要

LLM 代理如今通过文本进行通信,由于需要对共享者模型的状态进行自回归解码并在接收者模型上进行编码,因此会导致相当大的延迟和信息丢失。最近的工作,例如 Cache-to-Cache(C2C;Fu et al., 2026),试图通过学习将共享者 KV 矩阵转换为接收者模型的适配器来交换 KV 缓存。然而,适配器体积庞大,训练和翻译单个标记的成本昂贵,这要求目标上下文相同。这不适合代理通信,其中 LLM 具有不同的上下文。我们引入潜在缓存流(LCF)。为了提高效率,我们发现键和值可以联合转换和压缩,从而将适配器的大小减少到 C2C 大小的 4% 左右。为了解决不同的上下文,我们设计适配器来传输目标模型没有的新信息的摘要。我们的早期实验表明,在共享上下文设置中,经过修剪的 13 MB LCF 适配器可以比 956 MB 的 C2C 更准确;对于不同的上下文,LCF 将 F1 提高了 7.5%,精确匹配提高了 23%,同时比基于文本的通信快了 8.5 倍。