论文
SortedRL:通过在线长度感知调度加速 LLM 的 RL 训练
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
摘要
扩展强化学习 (RL) 在增强 大语言模型 (LLM) 的推理能力方面显示出强大的前景,特别是在需要长思维链生成的任务中。然而,RL 训练效率通常受到轨迹采样阶段的瓶颈,由于自回归生成缓慢以及轨迹采样和策略更新之间的同步开销,在生成长轨迹(例如 16k 个词元)时,轨迹采样阶段可能占总训练时间的 70%。我们提出了 SortedRL,这是一种在线长度感知调度策略,旨在通过提高轨迹采样效率和保持训练稳定性来解决这一瓶颈。 SortedRL 根据输出长度重新排序轨迹采样样本,优先考虑形成组的短样本以进行早期更新。这使得大批量轨迹采样、灵活更新批量以及近同策略微课程建设同时进行。为了进一步加速管道,SortedRL 采用了一种机制,通过基于缓存的机制来控制 离策略 训练的程度,并得到专用 RL 基础设施的支持,该基础设施通过有状态控制器和轨迹采样缓冲区来管理轨迹采样和更新。使用 LLaMA-3.1-8B 和 Qwen-2.5-32B 执行各种任务(包括逻辑谜题以及 AIME 24、Math 500 和 Minerval 等数学挑战)的实验表明,SortedRL 将 RL 训练气泡率降低了 50% 以上,同时在相同数据量的情况下,与基线相比,性能提高了 3.9% 至 18.4%。