论文
FoMoE:通过 MoE 联盟打破全副本障碍
FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs
摘要
预训练 大语言模型 (LLM) 通常需要具有紧密耦合硬件加速器的大规模基础设施。专家混合 (MoE) 架构将模型容量与每个词元的计算部分解耦。仅凭这种效率并不能使 MoE 在普通互联网链路或松散连接的商用硬件上进行训练,因为主动专家路由仍然采用高速数据中心结构。 DiLoCo 和 Photon 等低通信方法降低了分布式站点之间的同步频率,减轻了带宽限制,但仍然需要每个站点都有完整的模型副本。这就造成了一种不匹配:现代教育部的数据路径稀疏,但其分布式训练基础设施仍然是通信密集型且内存效率低下,从而限制了汇集地理分布式计算的尝试。在这项工作中,我们引入了 FoMoE,这是一个通过在工作人员之间划分专家层并在本地训练期间跳过非常驻专家来打破完整副本范式的系统。我们证明 FoMoE:(I)通过受控机制中的部分专家复制,将通信成本比有效基线降低了 1.42 倍,比分布式数据并行性 (DDP) 降低了 45.44 倍; (II) 通过skip-token机制实现高达1.4倍的经验吞吐量加速; (III) 显示了训练机制中的稳定路由,并通过系统建模将通信/内存优势投射到 100B 规模的配置。