论文

通过离散者感知组大小调整实现更快的同步 同策略 RL

Faster Synchronous On-Policy RL via Straggler-Aware Group Sizing

AI 基础设施分布式训练基础设施

摘要

组相对策略优化(GRPO)等同步强化学习方法提供了稳定且可重复的 同策略 训练,但它们很容易受到落后者的影响,一次异常长的执行轨迹可能会延迟整个组的奖励计算和参数更新。随着组规模的增加,这个问题变得更加严重,从而在更大的组的好处和同步停顿的挂钟成本之间产生了紧张关系。我们提出了离散者感知组控制(SAGC),这是一种动态组大小控制器,可根据观察到的执行轨迹行为在线调整训练组。 SAGC 将群体规模选择制定为在线约束优化问题,寻求保留较大群体的优势,同时控制掉队事件的长期发生率。在同步 GRPO 和 DAPO 训练中,除了普通基线和强大的工程基线之外,SAGC 始终如一地减少掉队者发生率并提高挂钟效率,同时获得有竞争力或更好的训练奖励。我们进一步表明,这些收益转移到了最终的模型质量:SAGC 与下游推理基准上最强的静态组大小基线竞争或更好,并且通常会产生更短的输出,而没有任何明确的长度惩罚。这些结果将动态群控制定位为一种使同步 同策略 RL 更加高效和鲁棒的实用方法。