论文

OpenForgeRL:在任意环境中训练Agent Harness原生的智能体

OpenForgeRL: Train Harness-native Agents in Any Environment

智能体系统模型训练强化学习Agent HarnessAgentic RL

摘要

现代AI智能体依赖精细的推理Agent Harness(如Claude Code、Codex与OpenClaw)驱动多轮推理、工具使用与外部系统访问。这些复杂Agent Harness虽然强大,却使智能体难以用开放基础设施端到端训练——其SFT/RL栈无法原生表达有状态、多进程的Agent Harness推理。为此我们提出OpenForgeRL,一个在多样环境中端到端训练基于Agent Harness智能体的开源框架:以轻量代理服务Agent Harness的模型调用、同时把它们记录为标准RL代码库(如veRL)的训练数据;以Kubernetes编排器把每次rollout运行在各自的远程容器——共同实现任意Agent Harness、任意环境的大规模训练。经解耦训练与推理,OpenForgeRL让研究者能在智能体实际部署所用的真实Agent Harness与环境中直接训练、研究并改进智能体。我们在多样复杂Agent Harness与环境上验证框架,横跨工具型/Claw型智能体与多模态GUI浏览器及计算机使用智能体。仅用数百到数千任务:OpenForgeClaw在ClawEval达31.7 pass^3与55.9 pass@3、QwenClawBench达33.7;OpenForgeGUI在OSWorld-Verified达37.7、Online-Mind2Web达63.0、WebVoyager达72.3。两者在几乎所有基准上胜过同规模开放基线,GUI设定下匹敌或超过大数倍的模型。超越基准,我们分析Agent Harness选择(ZeroClaw、OpenClaw、Codex)与RL如何塑造智能体行为:某些Agent Harness明显更难学;RL改善智能体可靠性——自验证、工具覆盖、完成多步计划——但错误恢复等关键能力仍弱。

OpenForgeRL:在任意环境中训练治控原生的智能体:论文配图
图 2:OpenForge RL 概述。协调器生成远程沙箱,其中 LLM/VLM 通过线束与其环境进行交互。代理拦截该工具的 LLM 调用,将它们路由到 RL 框架的推理引擎,并将交换的 io 对记录为训练轨迹。支持新的工具或环境只会修改沙箱。