论文
MetaAgent-X:用端到端强化学习突破自动多智能体系统的天花板
MetaAgent-X : Breaking the Ceiling of Automatic Multi-Agent Systems via End-to-End Reinforcement Learning
摘要
自动多智能体系统(MAS)旨在无需依赖手工设计或固定编排即可实例化智能体工作流。然而,现有自动MAS方法仅具备部分自适应性:它们要么执行免训练的测试时搜索,要么在优化元层设计者的同时冻结下游执行智能体,这造成了冻结执行器天花板,使自设计与自执行智能体模型的端到端训练悬而未决。为解决此问题,我们提出MetaAgent-X,一个联合优化自动MAS设计与执行的端到端强化学习框架。MetaAgent-X支持基于脚本的MAS生成、执行rollout收集,以及对设计者与执行器两类轨迹的贡献归因。为支持稳定且可扩展的优化,我们提出执行器-设计者分层Rollout与分阶段协同演化,以提升训练稳定性并揭示设计者-执行器协同演化的动态。MetaAgent-X持续超越现有自动MAS基线,增益最高达21.7%。全面的消融实验表明设计者与执行器在训练全程均持续改进,且有效的自动MAS学习遵循分阶段协同演化过程。这些结果确立了端到端可训练的自动MAS作为构建自设计与自执行智能体模型的实用范式。
