论文
多智能体RL何时能改进LLM工作流?工作流、规模与策略共享的权衡
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
摘要
多智能体LLM工作流通过专门化角色路由推理以提升端到端任务准确率,但用强化学习联合训练这些角色时会以鲜为人知的方式出现不稳定。我们研究多智能体LLM工作流的端到端RL训练何时能优于其基座模型,并将所有角色更新同一策略的Shared-Policy训练与每个角色拥有自己参数的Isolated-Policy训练进行对比。我们的实验矩阵涵盖Eval-Opt、Voting和Orch-Workers三种工作流、数学与代码任务,以及三个模型规模(0.6B、1.7B、4B)。我们发现多智能体RL通常优于基座模型,但收益同时取决于工作流、任务和规模,而非仅取决于策略共享与否。Isolated-Policy往往能达到更高的峰值准确率,却更容易出现终点准确率断崖;而Shared-Policy训练并不能消除失败,只是把失败重新分配为性质不同的模式。随后,我们通过由工作流拓扑和策略路由诱导的角色级梯度动态来解释其中最强的模式:在Isolated-Policy下,共享提示上的并行同角色智能体会放大每个角色的梯度,导致Voting和Orch-Workers工作流出现终端退化;在Shared-Policy下,不对称的每步梯度质量使共享策略被主导角色俘获,产生随任务和工作流而异的不同失败特征。总体而言,这一实证图谱及其背后的机制表明,策略共享是将训练压力导向不同渠道,而非提供一致的稳定性,因而是一项带有工作流和任务条件权衡的设计选择。