论文
异构语言模型间的双缓存潜空间通信
Dual-Cache Latent Space Communication between Heterogeneous Language Models
摘要
多智能体LLM系统把工作分给多个模型,因此回答常常需要位于另一个智能体上下文中的知识:一个Sharer已编码了Receiver完成任务所需的信息。它们通常通过交换文本来通信,这让自回归解码进入关键路径,并把交换简化为一条在看不见接收方状态的情况下写出的离散消息。近期的潜在协议转而把共享者的键值(KV)缓存翻译到接收方的缓存:C2C支持异构模型,但要求两者读取相同输入;LCF-X通过无位置的共享者缓存池化移除了这一共享上下文要求。仍存在三个限制:LCF-X只压缩共享者,向每个接收方位置提供相同的层局部摘要而没有可检索的联合跨层记忆,并假设层数与KV几何匹配。我们提出XKV,把这三个限制全部解除:学习查询的注意力对两个缓存进行池化;在接收方对齐的层token上做自注意力(用学习到的层映射调和不同深度),把池化摘要混合成紧凑的联合记忆;一个共享位置解码器让每个原始接收方缓存位置在接收方原生KV几何中检索自己的逐头门控残差。两个模型都保持冻结,且可在家族、深度、KV头数、头维度和分词器上不同;只有翻译器被训练。在45个数据集-模型-配对设置(六个异构有序配对和三个同模型有序配对,五个数据集)中,XKV取得最高的宏平均分数和最佳平均排名,在所有数据集上超过LCF-X(在ROPES上精确匹配高4.6分、F1高4.2分),并在五个数据集中的四个上超过文本通信,同时训练参数减少76%,翻译一对缓存快10.3倍(5.8毫秒对59.9毫秒);端到端,XKV比LCF-X快26%,比文本通信快6.8倍。
