论文

缓存合并作为多智能体潜在推理的收敛复制状态

Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning

模型推理KV Cache

摘要

多智能体潜在推理将智能体的 KV 缓存组合到最终智能体的一个上下文中。之前的工作(Agent Primitives)通过将沿着序列轴的缓存与 RoPE 重新编码(我们称之为 BagMerge)连接起来来实现这一点。 BagMerge 是不可交换的,并且最佳输入顺序是不可预测的,会随着机制、潜在步骤预算和模型规模而变化。我们使这种交换成为收敛复制状态。首先,CanonicalMerge 按内容修复布局:在中间层按平均 K 范数对缓存进行排序,使得合并后的缓存在任何输入排列下字节相同,经过算法验证(数量 N<=5),并在真实 Qwen3-1.7B 和 4B 状态上逐位进行验证。其次,我们将复制状态与解码时布局分开:状态是一组内容寻址的潜在片段,其合并为 set union,一个基于状态的 CvRDT(交换、结合、幂等、吸收),而 CanonicalMerge 是其确定性渲染。由于渲染是字节等效的,因此每个 N=2 的精度数都会保持不变,并且重新传递的重复项将被吸收而不是重新连接。在分区推理基准上,CanonicalMerge 在每个按预算按排序的机制中匹配最佳的 BagMerge 排序,而不知道哪个顺序最好,用很小的、统计上不显着的准确度余量换取无条件的结构保证。该行为转移到真正的多文档 QA (HotpotQA),而最接近的 无需训练 输出融合基线 (PackLLM) 在匹配预算下损失了 45 个点,将缓存级合并置于与输出级融合不同的机制中。最后,在 k>2 时,该方法传输并并置潜在痕迹,但其本身不能自行组合这些轨迹,我们将其描述为激励未来的工作。