OpenForgeRL:在任意环境中训练Agent Harness原生的智能体
OpenForgeRL: Train Harness-native Agents in Any Environment
摘要
现代AI智能体依赖精细的推理Agent Harness(如Claude Code、Codex与OpenClaw)驱动多轮推理、工具使用与外部系统访问。这些复杂Agent Harness虽然强大,却使智能体难以用开放基础设施端到端训练——其SFT/RL栈无法原生表达有状态、多进程的Agent Harness推理。为此我们提出OpenForgeRL,一个在多样环境中端到端训练基于Agent Harness智能体的开源框架:以轻量代理服务Agent Harness的模型调用、同时把它们记录为标准RL代码库(如veRL)的训练数据;以Kubernetes编排器把每次rollout运行在各自的远程容器——共同实现任意Agent Harness、任意环境的大规模训练。经解耦训练与推理,OpenForgeRL让研究者能在智能体实际部署所用的真实Agent Harness与环境中直接训练、研究并改进智能体。我们在多样复杂Agent Harness与环境上验证框架,横跨工具型/Claw型智能体与多模态GUI浏览器及计算机使用智能体。仅用数百到数千任务:OpenForgeClaw在ClawEval达31.7 pass^3与55.9 pass@3、QwenClawBench达33.7;OpenForgeGUI在OSWorld-Verified达37.7、Online-Mind2Web达63.0、WebVoyager达72.3。两者在几乎所有基准上胜过同规模开放基线,GUI设定下匹敌或超过大数倍的模型。超越基准,我们分析Agent Harness选择(ZeroClaw、OpenClaw、Codex)与RL如何塑造智能体行为:某些Agent Harness明显更难学;RL改善智能体可靠性——自验证、工具覆盖、完成多步计划——但错误恢复等关键能力仍弱。
