论文

异步 LLM 后期训练:群体质量上限和收敛分析

Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis

模型训练强化学习

摘要

异步强化学习 (RL) 提高了大语言模型后训练的效率,但引入了早期策略生成的陈旧部署。关于这种陈旧性如何影响收敛以及如何减轻其影响的理论理解仍然有限。我们推导了 GRPO 式算法的收敛界,该算法明确地表征了梯度估计器的二阶矩和偏差之间的权衡。对于轨迹级重要性加权估计器,我们的分析表明,一旦二阶矩得到统一控制,延迟就会通过裁剪或重新缩放引入的偏差进入界限。在这一见解的指导下,我们提出了一种新颖的群体质量上限 GRPO (GMC-GRPO) 方法,该方法可以最大限度地减少共享共同二阶矩保证的一类加权估计器中基于比率的偏差界限。我们建立了异步 GMC-GRPO 的收敛保证,并表明,与 TIC-GRPO 相比,它改善了从 $O(ε^{-4})$ 到 $O(ε^{-2})$ 的四阶延迟项的阈值依赖性,如 $ε\to0$,其中 $1+ε$ 是比率阈值。在本地策略重叠下,调整步长后,延迟相关项减小为 $G^{-2/5}$,其中 $G$ 是组大小。对于固定行为和当前策略,群体重新调整引入的偏差也会随着 $G\to\infty$ 消失,而轨迹剪切带来的偏差可能会持续存在。跨 Qwen3 模型和推理基准的实验表明,GMC-GRPO 对过时部署的鲁棒性有所提高,在较大的部署延迟下,GMC-GRPO 在稳定基线中实现了最佳性能。