论文

Agent Lightning v1.0:迈向Harness式Agentic RL

Agent Lightning v1.0: Towards Harnessed Agentic RL

模型训练智能体系统强化学习Agent HarnessAgentic RL

摘要

现代Agent运行在管理工具、上下文与控制流的Agent harness之内,这使harness成为Agent系统的关键组成部分。最初的Agent Lightning引入了一种解耦架构,通过LLM端点代理把任意Agent接入RL训练,这一做法后来被verl Uni-Agent、AReaL 2.0、slime和Polar等框架采用。我们将这一范式称为harness式Agentic RL(harnessed agentic RL),即部署时所用的harness直接参与模型后训练。harness式Agentic RL与传统Agentic RL有本质区别:拥有环境交互循环的是harness而非训练引擎,训练器只能观察到LLM请求-响应对序列。这带来了重分词、样本合并、优势计算、损失归一化和后端调度等挑战,它们会显著影响训练的稳定性与有效性。我们推出Agent Lightning v1.0,一个以约3,500行代码实现的轻量级harness式Agentic RL框架。它支持任意Agent harness,并可作为研究上述挑战的实用试验台。我们在指令遵循、搜索和编码Agent上对其进行评估,并为编码Agent RL提供完整的可复现流水线。仅使用6K训练样本和适中的算力,RL将Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%,绝对提升14.6个百分点。我们发布完整的工作流与训练脚本,以促进harness式Agentic RL的可复现研究。

Agent Lightning v1.0:迈向Harness式Agentic RL:论文配图
图12:Rollout Controller 将 API 网关中的 rollout 状态与以 Kubernetes Job 或本地进程形式运行的智能体执行进行核对对齐。