论文

LEGO-RL:面向编码Agent的Harness原生强化学习

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

模型训练智能体系统AI 基础设施强化学习Agent HarnessSandboxRLVRAgentic RLAgent Sandbox

摘要

编码Agent的强化学习日益依赖长时间运行的Agent harness来管理工具集成、仓库上下文和执行反馈。然而,这些harness的原生执行环境与策略梯度训练存在天然错位:环境崩溃和奖励劫持会污染结果信号,而训练-推理差异使rollout行为与策略更新脱钩。为此,我们提出LEGO-RL,一个在不修改harness内部控制流的前提下,把原生编码Agent harness与可扩展的策略梯度优化衔接起来的框架。LEGO-RL建立在三大支柱上:(1)通过进程内LLM代理实现忠实优化,捕获原始生成流以完成token级对齐和稳健的训练端log概率重算,即使在harness侧发生压缩或重序列化时也能工作;(2)通过具备镜像缓存与分阶段防御的可扩展沙箱编排实现可靠执行,以缓解奖励劫持;(3)通过集成插件实现可观测训练,自动化验证与监控,并配备用于细粒度轨迹诊断的Live UI。我们通过在三个原生编码Agent harness上以GSPO训练稀疏MoE模型Qwen3.5-35B-A3B来评估LEGO-RL。LEGO-RL在SWE-bench Verified上将Qwen3.5-35B-A3B在OpenHands SDK上从64.0%提升至70.4%,在Claude Code上从62.4%提升至68.2%,在OpenCode上从57.2%提升至66.6%,同时保持rollout-训练概率相关性高于0.99。

LEGO-RL:面向编码Agent的Harness原生强化学习:论文配图
图1:Lego-RL 训练基础设施概览。