论文
UnityMAS-O:面向基于LLM的多智能体系统的通用RL优化框架
UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems
摘要
基于LLM的多智能体系统将复杂任务分解为相互交互的角色,但大多数仍由提示、工具与控制规则手工编排,智能体很少通过统一的强化学习接口进行优化。现有强化学习后训练框架主要面向单策略优化,缺乏对用户自定义多智能体工作流、结构化交互、角色专属贡献归因与可配置参数共享的抽象。我们提出UnityMAS-O,一个面向基于LLM多智能体系统的通用强化学习优化框架。UnityMAS-O将完整工作流而非单个响应或策略轨迹作为优化单元。它通过四个一等对象表示工作流:逻辑智能体角色、图轨迹、用户自定义奖励以及智能体-模型映射。这将逻辑智能体与物理模型参数解耦,支持完全共享、完全分离与部分共享,奖励可在角色、轮次与轨迹层级分配。UnityMAS-O在verl基础上扩展了一个基于Ray的星型拓扑运行时。中央控制器执行工作流、调用工具、记录结构化轨迹并汇总奖励;模型本地的工作组负责rollout、缓冲、优势计算与分布式PPO式更新。用户无需重写优化基础设施即可定义智能体、工作流、模型映射与奖励。我们在检索增强问答、迭代式智能体搜索与反思式代码生成上实例化UnityMAS-O。在Natural Questions、HotpotQA与留出代码任务上,优化后的多智能体强化学习改进了手工指定的工作流,对小模型与严格的代码全通过指标的增益尤为显著。这些结果表明,UnityMAS-O可作为可复用底座,将多样的基于LLM的多智能体工作流转化为可训练的多智能体强化学习系统。
