论文

学会通信:迈向多智能体语言系统的端到端优化

Learning to Communicate: Toward End-to-End Optimization of Multi-Agent Language Systems

智能体系统Agent 协作

摘要

基于大语言模型的多智能体系统在复杂推理任务上展现出强大性能,但大多数工作聚焦于智能体角色与编排,而将智能体间通信视为固定接口。通过键值缓存(key-value cache)等内部表示进行的潜在通信为基于文本的协议提供了有前景的替代方案,但现有方法并未将通信与多智能体推理进行联合优化。因此,我们提出DiffMAS,一个将潜在通信视为多智能体系统可学习组件的训练框架。DiffMAS在多智能体潜在轨迹上执行参数高效的监督训练,使智能体能够联合学习在交互过程中信息应如何被编码与解读。在数学推理、科学问答、代码生成和常识基准上的实验表明,与单智能体推理、基于文本的多智能体系统以及既有潜在通信方法相比,DiffMAS持续提升推理准确率与解码稳定性,在AIME24上取得26.7%、在GPQA-Diamond上取得20.2%,并在各推理基准上保持一致增益。

学会通信:迈向多智能体语言系统的端到端优化:论文配图
图 1:在第一阶段,代理 1 到 K-1 通过预填充现有缓存并附加新生成的 KV 段(无需梯度更新)来顺序构建共享 KV 跟踪。累积的 KV 跟踪充当跨代理的潜在通信媒介。在阶段 II 中,最终代理对预填充的 KV 缓存执行自回归解码。 KV 轨迹上的交叉注意力会产生隐藏状态,这些隐藏状态通过 LM 头投影以生成令牌。使用交叉熵损失进行监督微调,并反向传播梯度以仅更新最终代理的 LoRA 参数,同时保持骨干模型冻结。