论文
ToolVerse:为智能体强化学习解锁大规模环境与长程任务
ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
摘要
尽管LLM智能体在紧凑且定义良好的场景中展示了很强的推理能力,面对需要无缝工具集成的大规模、多样且动态的真实环境时,仍难以保持稳健与有效。为弥合这一差距,我们提出ToolVerse,一个扩展智能体RL环境规模、使智能体能在工具集成推理(TIR)任务中执行复杂长程推理的综合框架。第一,ToolVerse从近400个真实世界的模型上下文协议(MCP)、约4500个工具中自动构建大规模可执行的智能体训练环境。第二,我们提出基于工具依赖图的任务设计策略,用动态解锁采样算法生成长程任务,产出GUST(图解锁采样任务)数据集。第三,为缓解长程智能体RL中的信用分配问题,我们提出细粒度的回合感知相对优势算法。我们使用ToolVerse开展大量智能体RL训练,并在多个智能体基准上评估:结果表明该框架显著增强LLM的长程工具使用能力,性能明显提升,并在动态环境中展现稳健推理。
