论文

LEMON:通过反事实强化学习学习可执行的多智能体编排

LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning

智能体系统模型训练强化学习Agent 协作Agent HarnessRLVRAgentic RL

摘要

大语言模型(LLM)已成为多智能体系统的强大基础,但其效果在很大程度上取决于编排设计。在不同任务中,角色设计、能力等级分配与依赖结构构建共同影响解的质量与执行效率。现有方法将这一设计过程的部分环节自动化,但往往只对这些决策做局部或串行优化,且依赖的执行级反馈难以为局部编排决策提供充分的贡献归因。我们提出LEMON(通过反事实强化学习学习可执行多智能体编排),一个基于LLM的编排器,可生成可执行的编排规范。该规范将任务特定角色、定制职责、能力等级与依赖结构整合为单一可部署系统。为训练编排器,我们在编排级GRPO目标之上加入局部化反事实信号:对角色、能力或依赖字段进行编辑,并将由此产生的奖励对比仅归因于被编辑的片段。在MMLU、GSM8K、AQuA、MultiArith、SVAMP和HumanEval六个推理与编码基准上的实验表明,LEMON在所评估的多智能体编排方法中取得最先进性能。代码见https://anonymous.4open.science/r/LEMON-B23C。

LEMON:通过反事实强化学习学习可执行的多智能体编排:论文配图
图1:稀疏且局部的信用分配下,分解式与组合式编排生成的对比,LEMON取后者可执行路线。