论文

ToolGym:用于可扩展代理测试和数据管理的开放世界工具使用环境

ToolGym: an Open-world Tool-using Environment for Scalable Agent Testing and Data Curation

智能体系统Agent任务评测

摘要

使用工具的 LLM 代理仍然在开放世界环境中苦苦挣扎,这些环境具有庞大的工具池、长远的目标、狂野的约束和不可靠的工具状态。为了实现可扩展且真实的培训和测试,我们引入了开放世界的工具使用环境,该环境基于 204 个常用应用程序的 5,571 种格式统一工具构建。它包括一个任务创建引擎,可综合具有广泛约束的长期多工具工作流程,以及一个状态控制器,可注入中断和故障以对鲁棒性进行压力测试。在此环境之上,我们开发了一个工具“选择然后执行”代理框架,该框架具有计划者-参与者分解,以将故意推理和自我纠正与逐步执行分开。对最先进的大语言模型的综合评估揭示了工具规划和执行能力之间的错位、现有大语言模型弱点的限制以及 DeepSeek-v3.2 最强的鲁棒性。最后,我们从环境中收集 1,170 个轨迹来微调 LLM,使用 119k 样本实现优于基线的性能,表明该环境作为使用工具的代理的现实基准和数据引擎的价值。我们的代码和数据将公开发布。

C-World:计算机使用智能体环境创建器 配图
图 1:ToolGym 总体框架。流水线始于策展真实世界的 MCP 工具并合成带有严苛约束(wild constraints)的任务(左)。智能体采用规划器-执行器(Planner–Actor)架构分解长程目标,其中执行器经由状态控制器(State Controller)与环境交互。关键之处在于,控制器会拦截工具调用,在真实服务器上执行之前注入逼真的故障(例如超时、状态变化)。所产生的轨迹既支持严格的评估(Evaluation),也支持用于模型训练的高质量数据策展(Data Curation)。