论文

EvoMAS:为多智能体系统学习执行时工作流

EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

智能体系统模型训练强化学习Agent 协作Agent HarnessAgentic RL

摘要

基于大语言模型(LLM)的多智能体系统通过智能体专业化、工具使用和协作推理在复杂任务上显示出强大的潜力。然而,大多数自动化多代理系统设计方法仍然遵循一次性范例:在执行之前优化或选择工作流程,然后在整个任务中不加修改地重复使用。这种静态协调策略不适合长期任务,这些任务的子目标、中间证据和信息需求会在多个执行阶段演变。我们提出了 EvoMAS,一个用于执行时多代理工作流构建的框架。 EvoMAS 将工作流构建制定为沿着单个任务轨迹的元级顺序决策问题。在每个阶段,它通过规划器-评估器-更新器管道构建显式任务状态,并使用学习的工作流适配器从固定的候选代理池中实例化特定于阶段的分层工作流。该适配器使用稀疏、可验证的终端任务成功作为主要监督信号,通过策略梯度进行训练,同时在非常困难的稀疏奖励设置下单独分析基于评估器的过程奖励。 GAIA、HLE 和 DeepResearcher 上的实验表明,EvoMAS 的性能优于单智能体基线和最新的自动化多智能体工作流程设计方法。我们的分析进一步表明,明确的任务状态构建和学习的工作流程适应提供了互补的优势。其他结果表明,当最终成功极其稀少时,过程奖励最为有用,定性案例研究表明,EvoMAS 随着任务状态的发展而调整代理协调。

EvoMAS:为多智能体系统学习执行时工作流:论文配图
图 1:执行时多代理工作流构建的元级 MDP 公式。基于元状态 stms_{t}^{m} 选择工作流程 𝒢t\mathcal{G}_{t},诱导基础级多代理执行和聚合结果 ψt\xi_{t}。橙色箭头表示元级别转换,蓝色箭头表示基础级别代理执行。