论文
MCP-Universe RL:通过强化学习训练MCP工具使用智能体的框架
MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning
摘要
强化学习(RL)已成为提升大语言模型(LLM)工具使用能力的有效途径,但现有RL框架大多止步于策略更新。对每个新领域,用户都面临两个棘手的系统问题:为数百条并发轨迹各自搭建隔离环境并将其接入训练,以及调度rollout,使GPU在漫长的多轮episode中保持忙碌——这些episode有大量时间停滞在缓慢的工具调用上。我们提出MCP-Universe RL(MCP-U RL),一个接管这两者的开源框架。它使用模型上下文协议(MCP)作为环境接口,因此任何已作为MCP服务器暴露的工具都能无需RL专属集成代码即接入训练。它一次性构建两个缺失的层并跨领域复用:环境编排层,在可插拔容器后端上供应、隔离和回收MCP环境;rollout编排层,其分段管线在episode等待工具时重叠轨迹以保持GPU忙碌。后端无关的训练层再通过现有RL后端施加更新,已有veRL和slime集成。使用同一配置、只改任务规格,我们在gpt-oss-20b上训练软件工程、深度研究和通用工具使用智能体,并在三者上均提升了任务奖励。
