论文

异步 GRPO 中崩溃的缩放定律

Scaling Laws for Collapse in Asynchronous GRPO

模型训练强化学习

摘要

异步强化学习通过将轨迹采样与策略优化解耦来提高 大语言模型 后训练 的吞吐量,但会引入行为和学习器策略之间的不匹配。由此产生的策略陈旧性如何与控制训练稳定性和崩溃时间的学习率相结合仍然知之甚少。我们通过 Llama-3.2-1B/3B 上的同步间隔 $S$ 和恒定学习率 $η$ 的受控扫描来研究普通 GRPO 中的这种耦合,并通过 Qwen3-8B 上的实验进行补充。我们确定了两个经验缩放定律:(i)稳定性边界缩放:最大的稳定学习率大约为$S^{-1}$,产生一个以近似恒定乘积$Sη$为特征的稳定性边界。 (ii) 崩溃时间缩放:在崩溃运行中,估计的崩溃时间缩放大约为 $η^{-1}$,对应于模型和设置相关的累积学习率预算,该预算在 Llama 扫描中的同步间隔内对齐。我们通过对行为依赖的 GRPO 替代项和补充平均场模型的局部分析来解释这些定律。在局部规律性条件下,分析得出在同步时重置的过时引起的更新偏差的 $O(Sη)$ 上限。平均场模型显示了当更新方向在同步周期中持续存在时,足够强的正反馈可以维持方向漂移。当漂移速度在优化器归一化下饱和时,该机制预测在近似固定的累积学习率后退出局部代理有效性区域。总之,这些发现激发了实用的校准规则:通过粗略扫描估计稳定性阈值和崩溃预算,然后为预期的训练范围联合选择 $S$ 和 $η​​$。