论文

MAS-Orchestra:经整体编排与受控基准理解并改进多智能体推理

MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks

模型训练智能体系统强化学习Agent HarnessAgentic RL

摘要

虽然多智能体系统 (MAS) 有望通过协调智能体来提高智能,但当前的自动 MAS 设计方法却未能实现这一目标。这些缺点源于两个关键因素:(1) 方法复杂性 - 代理编排是使用顺序、代码级执行来执行的,这限制了全局系统级整体推理,并且随着代理复杂性的扩展性较差 - 以及 (2) 功效不确定性 - 部署 MAS 时不了解与单代理系统 (SAS) 相比是否有切实的好处。我们提出了 MAS-Orchestra,这是一个训练时框架,它将 MAS 编排制定为具有整体编排的函数调用强化学习问题,立即生成整个 MAS。在 MAS-Orchestra 中,复杂的、面向目标的子代理被抽象为可调用函数,从而能够对系统结构进行全局推理,同时隐藏内部执行细节。为了严格研究 MAS 何时以及为何有益,我们引入了 MASBENCH,这是一个受控基准,它沿五个轴表征任务:深度、地平线、广度、并行性和鲁棒性。我们的分析表明,MAS 的收益主要取决于任务结构、验证协议以及协调器和子代理的能力,而不是普遍存在。在这些见解的指导下,MAS-Orchestra 在公共基准上实现了持续改进,包括数学推理、多跳 QA 和基于搜索的 QA。 MAS-Orchestra 和 MASBENCH 共同支持更好地训练和理解 MAS,以追求多智能体智能。

MAS-Orchestra:经整体编排与受控基准理解并改进多智能体推理
图1:范式比较与 Mas-Orchestra。左:推理时编排系统通常采用整体式编排,但缺乏训练。Mas-Orchestra 的特点在于自动化的 MAS,并把问题表述为采用整体式编排的函数调用 RL 问题。右:当 DoM 被配置为低(虚线)时,系统最多实例化一个智能体;当 DoM 高时,智能体数量不受限制。函数调用协议与解析器的细节见附录 H 和 I 。