论文
ThunderSyncRL:在保持策略同步的条件下无损加速Agentic强化学习
ThunderSyncRL: Lossless Acceleration of Agentic Reinforcement Learning
摘要
语言模型正在从生成答案转向在交互环境中追求长时域目标。这类智能体的后训练需要冗长且异质的执行轨迹,同步系统会让学习引擎闲置,直至轨迹执行和验证结束。为了消除这些流水线空隙,异步训练把不同更新之间的轨迹执行与学习重叠,但代价是策略滞后。我们提出ThunderSyncRL:一旦所需输入全部确定,便开始计算梯度,同时不产生策略滞后。对于组相对策略优化(GRPO),ThunderSyncRL在每条轨迹的奖励到达后立即计算该轨迹的得分梯度,无需等待整组轨迹。对于在策略蒸馏(OPD),它在工具调用仍于沙箱中运行时,为每个已完成Agentic回合中由教师模型评分的动作计算梯度。我们证明,梯度流式计算产生与批次同步训练相同的GRPO和OPD更新,不改变任何一个目标函数。在SWE-bench Verified和Terminal Bench 4.0上,我们以相同性能训练模型,相较同步训练最高加速$1.9 \times$。在策略零滞后的条件下,ThunderSyncRL在固定预算下也优于异步训练,最高提高$2.47$个百分点。
