论文

用于代理强化学习的单条执行轨迹异步优化

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 对于 后训练 大语言模型 (LLM) 来说变得越来越重要。 LLM 之前的 RL 管道大多是同步和批量交错的,这对于长期代理任务来说效率低下。最近,异步强化学习通过在执行轨迹采样时更新模型而成为一种更有效的替代方案。然而,现有的异步强化学习系统通常强调吞吐量,而训练稳定性和任务有效性在很大程度上尚未得到充分探索。例如,一个关键的挑战是广泛使用的 GRPO 框架中的分组采样并不自然适合异步代理训练。在本文中,我们提出了单条执行轨迹异步优化 (SAO),以解决异步 RL 中的稳定性和 离策略 挑战。为了减少 离策略 效应并提高泛化能力,我们将分组采样替换为单转出采样,即每个提示使用一次转出。我们进一步改进了这种具有实用价值的单条执行轨迹策略——模型训练 设计。为了提高优化稳定性,我们引入了严格的双面 词元级 裁剪策略。 SAO 能够稳定训练一千步,并且在代理编码和推理基准上始终优于 GRPO 及其变体,例如 SWE-Bench Verified、BeyondAIME 和 IMOAnswerBench。我们还证明,单条执行轨迹的强化学习在模拟在线学习环境中特别有效,其中模型必须适应不断变化的环境。为此,SAO 成功部署在代理 RL 管道中,用于训练开放的 GLM-5.2 模型 (750B-A40B)。