论文

DORA:可扩展的异步语言强化学习系统 模型训练

DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training

AI 基础设施分布式训练基础设施

摘要

强化学习 (RL) 已成为 LLM 后训练 的关键范例,但部署阶段(占总步骤时间的 50--80%)因倾斜生成而受到瓶颈:模型性能不可或缺的长尾轨迹阻碍了整个训练流程。异步训练通过重叠生成和训练提供了一种自然的补救措施,但在效率和算法正确性之间引入了根本的紧张关系。我们确定了异步训练中的三个约束以保持收敛:轨迹内策略一致性、数据完整性和有界陈旧性。现有方法无法从本质上解决长尾轨迹问题,而混合专家模型的不平衡特性进一步加剧了长尾轨迹问题,或者偏离了标准强化学习训练公式,从而阻碍了模型收敛。因此,我们提出了DORA(Dynamic ORchestration for Asynchronous Rollout),它通过算法系统协同设计来解决这一挑战。 DORA 引入了多版本流式部署,这是一种新颖的异步范例,可以同时维护多个策略版本——同时实现完全泡沫消除,而不会影响算法约束。实验结果表明,我们的 DORA 系统在吞吐量方面取得了显着提高,在开源基准测试中比最先进的系统高出 2--3 倍,而且不影响收敛性。此外,在拥有数万个加速器的大规模工业应用中,与多场景同步训练相比,DORA 可以将 RL 训练加速 2--4 倍。由此产生的开源模型 LongCat-Flash-Thinking 在复杂推理基准上表现出具有竞争力的性能,与最先进的 LLM 的功能相匹配。