论文

MCP-Universe RL:通过强化学习训练MCP工具使用智能体的框架

MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning

AI 基础设施模型训练智能体系统强化学习智能体互操作协议AI 开发与运维平台Agentic RLMCP

摘要

强化学习(RL)已成为提升大语言模型(LLM)工具使用能力的有效途径,但现有RL框架大多止步于策略更新。对每个新领域,用户都面临两个棘手的系统问题:为数百条并发轨迹各自搭建隔离环境并将其接入训练,以及调度rollout,使GPU在漫长的多轮episode中保持忙碌——这些episode有大量时间停滞在缓慢的工具调用上。我们提出MCP-Universe RL(MCP-U RL),一个接管这两者的开源框架。它使用模型上下文协议(MCP)作为环境接口,因此任何已作为MCP服务器暴露的工具都能无需RL专属集成代码即接入训练。它一次性构建两个缺失的层并跨领域复用:环境编排层,在可插拔容器后端上供应、隔离和回收MCP环境;rollout编排层,其分段管线在episode等待工具时重叠轨迹以保持GPU忙碌。后端无关的训练层再通过现有RL后端施加更新,已有veRL和slime集成。使用同一配置、只改任务规格,我们在gpt-oss-20b上训练软件工程、深度研究和通用工具使用智能体,并在三者上均提升了任务奖励。

MCP-Universe RL:通过强化学习训练MCP工具使用智能体的框架:论文配图
图1:MCP-Universe 强化学习框架概览。每个领域以一个或多个 MCP 服务器的形式暴露,所有领域经单一 MCP 接口汇入同一个共享训练循环,其环境编排、rollout 编排与训练引擎各层对所有领域复用;只有任务规格发生变化。