论文

ThunderSyncRL:在保持策略同步的条件下无损加速Agentic强化学习

ThunderSyncRL: Lossless Acceleration of Agentic Reinforcement Learning

AI 基础设施分布式训练基础设施

摘要

语言模型正在从生成答案转向在交互环境中追求长时域目标。这类智能体的后训练需要冗长且异质的执行轨迹,同步系统会让学习引擎闲置,直至轨迹执行和验证结束。为了消除这些流水线空隙,异步训练把不同更新之间的轨迹执行与学习重叠,但代价是策略滞后。我们提出ThunderSyncRL:一旦所需输入全部确定,便开始计算梯度,同时不产生策略滞后。对于组相对策略优化(GRPO),ThunderSyncRL在每条轨迹的奖励到达后立即计算该轨迹的得分梯度,无需等待整组轨迹。对于在策略蒸馏(OPD),它在工具调用仍于沙箱中运行时,为每个已完成Agentic回合中由教师模型评分的动作计算梯度。我们证明,梯度流式计算产生与批次同步训练相同的GRPO和OPD更新,不改变任何一个目标函数。在SWE-bench Verified和Terminal Bench 4.0上,我们以相同性能训练模型,相较同步训练最高加速$1.9 \times$。在策略零滞后的条件下,ThunderSyncRL在固定预算下也优于异步训练,最高提高$2.47$个百分点。

ThunderSyncRL:在保持策略同步的条件下无损加速Agentic强化学习的原论文方法或结果图
图3:同步Agentic强化学习的流水线空隙。图中展示SWE-smith上GRPO训练的GPU利用率,轴上方为四个轨迹执行GPU,下方为四个学习GPU。随着长尾轨迹完成,轨迹执行利用率(生成槽位的繁忙比例)下降;斜线带表示闲置时间。$\bullet$ 同步学习器每步有49.5%的时间在等待最后一个奖励,轨迹执行GPU在学习器训练期间等待。$\bullet$ ThunderSyncRL在各轨迹奖励到达时启动其反向传播;在同步方案完成8次优化器更新所需的GPU小时内,它完成15次更新。