论文

EnvFactory:通过可执行环境综合和鲁棒强化学习来扩展工具使用代理

EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

模型训练合成数据

摘要

通过代理强化学习 (Agentic RL) 为 LLM 配备工具使用功能面临两个挑战:缺乏可扩展、稳健的执行环境,以及缺乏捕获隐式人类推理的真实训练数据。现有方法依赖于昂贵的现实世界 API、容易产生幻觉的 LLM 模拟器或通常是单轮或依赖于预先收集的文档的合成环境。此外,合成轨迹经常被过度指定,类似于指令序列而不是自然的人类意图,从而降低了强化学习训练的有效性。我们推出了 EnvFactory,这是一个可以解决这两个挑战的全自动框架。 EnvFactory 自主探索和验证来自真实资源的有状态、可执行工具环境,并通过拓扑感知采样和校准细化合成自然多轮轨迹,生成具有隐含意图的环境关联查询。 EnvFactory 仅使用 7 个域中的 85 个经过验证的环境,生成 2,575 个 SFT 和 RL 轨迹。尽管使用的环境比之前的工作少得多(通常是之前的 5 倍),EnvFactory 仍然实现了卓越的训练效率和下游性能,将 Qwen3 系列模型在 BFCLv3 上提高了 15%,在 MCP-Atlas 上提高了 8.6%,在对话基准(包括 $τ^2$-Bench 和 VitaBench)上提高了 6%。通过完全自动化环境构建和轨迹合成,EnvFactory 为 Agentic RL 提供了可扩展、可扩展且强大的基础。