论文

ClawGym II:探索 Agent Harness 上的黑盒强化学习

ClawGym II: Exploring Black-Box RL on Agent Harness

模型训练强化学习

摘要

代理利用通过协调代理与环境的交互,显着提高了长期任务的性能。然而,通过复杂的手段进行强化学习在很大程度上仍未得到探索,因为将此类训练扩展到长期代理任务会带来根本性的挑战。在这项工作中,我们提出了一个统一的黑盒强化学习框架,用于通过复杂的工具对通用代理进行稳定且可扩展的优化。具体来说,我们首先构建一个基于沙箱的执行基础设施,该基础设施隔离任务环境并利用临时沙箱进行大规模并发执行轨迹采样。然后,我们将策略优化与不透明的Harness执行分离,并在模型边界放置一个服务代理来捕获模型调用。为了重建多轮轨迹并提高训练效率,我们将捕获的调用组织成前缀树,并进一步采用基于批评家的 PPO 和无批评家的 GRPO 来优化恢复的树结构。同时,我们在整个优化过程中保持训练-推理的一致性。最后,我们引入了混合Harness训练,允许通过异构Harness联合优化单个模型。使用 Qwen3-30A3B,黑盒 RL 通过 OpenClaw 和 Claude 代码将 ClawGym-Bench 上的 Pass@1 分别提高了 9.98 和 14.81 分,同时在 200-400 个优化步骤中保持稳定。此外,该框架在 JobBench 和 OfficeQA 等更具挑战性的任务上获得了持续的收益。总的来说,我们的框架通过黑盒工具实现了通用代理的有效、稳定和可扩展的优化,支持跨异构执行系统的统一训练。