论文

EnvCraft:在 Agentic RL 中为 Claw-like Agent 合成可执行环境

EnvCraft: Synthesizing Executable Environments in Agentic RL for Claw-like Agent

模型训练AI 基础设施强化学习合成数据SandboxAgentic RLAgent Sandbox

摘要

大语言模型的范式已迅速从被动语言界面转变为自主的爪状智能体,可以在有状态的工作空间中执行长期任务。虽然智能体强化学习(Agentic RL)提供了一条优化这些智能体的有前途的途径,但其扩展却因交互式训练环境的严重缺乏而受到严重瓶颈。现有的合成环境严格限于工具调用端点,这使得它们不足以满足爪状智能体的端到端现实世界需求。为了弥补这一差距,我们引入了 EnvCraft,这是一个用于合成可执行环境和可扩展训练数据的自动化框架。具体来说,EnvCraft 采用环境综合引擎来构建沙箱隔离的工作空间,并使用拓扑感知数据生成引擎来生成连贯的任务轨迹。总体而言,我们合成了 139 个交互式环境,其中包含大约 20K 个复杂任务,用于 Agentic RL 训练。 Qwen3/3.5 模型 (8B-32B) 上的实验表明,我们的方法在 Claw 式基准上的增益高达 +11.9%,在一般工具使用基准上的增益高达 +8.0%,同时推理Token成本也降低了。结果证实,合成的可执行环境为训练提供了强大且可概括的学习信号。

EnvCraft:在 Agentic RL 中为 Claw-like Agent 合成可执行环境:论文配图
图 1:RL 中代理交互循环的图示。环境从根本上包括环境文档、显式状态定义和一套工具接口。