论文

DisagMoE:通过分解 AF-Pipe 并行性进行计算通信重叠 MoE 训练

DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism

AI 基础设施分布式训练基础设施

摘要

专家混合 (MoE) 架构可通过稀疏激活的专家实现万亿参数 LLM。专家并行(EP)是一种广泛采用的 MoE 训练策略,但它遇到了严重的端到端通信瓶颈,随着模型规模的不断增长,需要将专家分布在 GPU 节点上,有限的节点间网络带宽加剧了这种瓶颈。之前的工作重点是将这些全对全通信与前馈网络(FFN)和自注意力计算重叠,这通常会由于注意力和 FFN 层的计算通信比率的固有不平衡而留下残留的网络限制停顿。我们推出了 DisagMoE,这是一种分类的 MoE 训练系统,可联合优化模型放置和调度,以实现最大效率。 DisagMoE 将注意力层和 FFN 层分成不相交的 GPU 组,引入具有单向、多对多通信的多级管道,并采用计算通信屋顶线模型来平衡注意力和 FFN 组之间的 GPU 和网络带宽分配。 DisagMoE 在 Megatron-LM 上实现,评估表明 DisagMoE 提高了多个 MoE 模型的训练效率,在 16 节点 8xH800 集群上加速高达 1.8 倍。