论文

ToolVerse:为智能体强化学习解锁大规模环境与长程任务

ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning

模型训练智能体系统强化学习智能体互操作协议Agentic RLMCP

摘要

尽管LLM智能体在紧凑且定义良好的场景中展示了很强的推理能力,面对需要无缝工具集成的大规模、多样且动态的真实环境时,仍难以保持稳健与有效。为弥合这一差距,我们提出ToolVerse,一个扩展智能体RL环境规模、使智能体能在工具集成推理(TIR)任务中执行复杂长程推理的综合框架。第一,ToolVerse从近400个真实世界的模型上下文协议(MCP)、约4500个工具中自动构建大规模可执行的智能体训练环境。第二,我们提出基于工具依赖图的任务设计策略,用动态解锁采样算法生成长程任务,产出GUST(图解锁采样任务)数据集。第三,为缓解长程智能体RL中的信用分配问题,我们提出细粒度的回合感知相对优势算法。我们使用ToolVerse开展大量智能体RL训练,并在多个智能体基准上评估:结果表明该框架显著增强LLM的长程工具使用能力,性能明显提升,并在动态环境中展现稳健推理。

ToolVerse:为智能体强化学习解锁大规模环境与长程任务:论文配图
图 1:ToolVerse 框架概述。第 1 步:扩展可执行代理环境:我们自动将原始工具定义转换为可执行 MCP 环境。步骤2:基于图的长期任务综合:构建工具依赖图来对逻辑数据流进行建模。我们采用动态解锁采样算法来合成长视野任务。步骤3:回合感知相对优势估计:我们根据任务的特点提出回合感知优势算法。