论文

并行和分布式推理语言模型的性能基础

Performance Foundations of Parallel & Distributed Reasoning Language Models

AI 基础设施分布式训练基础设施

摘要

可验证奖励的强化学习 (RLVR) 和其他 RL 风格的 后训练 范式已用于使 大语言模型 (LLM) 与推理标准保持一致。由此产生的最新推理语言模型 (RLM),例如 DeepSeek-R1、o3 和 Kimi k1.5,表明这种 RL 风格的 后训练(“RL-for-LLM”)可以显着改善思想链推理、长期规划和自我纠正。然而,这些系统的计算量巨大:最先进的 RLM 训练需要数百万个 GPU 小时和紧密耦合的多模型管道,这些管道对现代硬件的压力远远超出了经典的监督 LLM 训练。这使得 RLM 训练既是一个算法问题,也是一个并行和分布式系统问题。在这项工作中,为了促进开发同时具有高性能、可扩展性和成本效益的 RLM,我们首先将 RL-for-LLM 范式系统化,并提供对著名 后训练 算法框架的以计算为中心的分析:近端策略优化 (PPO)、组相对策略优化 (GRPO) 及其变体。其次,我们为 RL-for-LLM 开发了模型内和模型间并行策略的分类,涵盖传统技术(数据、张量、管道、序列、上下文和专家并行)以及用于多模型 RLM 训练的新型并行和优化技术,例如分解放置、阶段融合、混合并行和异步执行。我们利用并行计算的工作深度模型来使我们的分类法及其见解变得严格且可移植。最后,我们分析现有的 RLM 框架,提炼实用指南并概述构建可扩展、快速且经济高效的 RLM 的开放研究方向。