论文
EMO:可扩展 MoE 的简单渐进式训练
EMO: Frustratingly Easy Progressive Training of Extendable MoE
摘要
稀疏专家混合 (MoE) 模型提供了一种在不增加计算量的情况下扩展模型大小的强大方法,因为每个词元的 FLOP 仅取决于 k 个活跃专家,而不是 E 专家的总数。然而,这种不对称性在实践中造成了教育部的效率悖论:增加更多专家会导致内存和通信成本膨胀,导致实际训练效率低下。我们认为,出现这一瓶颈的部分原因是当前的 MoE 训练从一开始就分配了太多的专家,尽管早期数据可能无法充分利用这种能力。受此启发,我们提出了 EMO,这是一个简单的渐进式训练框架,它将 MoE 容量视为可扩展内存,并在训练过程中扩大专家库。 EMO 显式地对缩放定律中的稀疏性进行建模,以导出用于渐进扩展的阶段式计算最优 词元预算。经验结果表明,EMO 在大规模实验中与固定专家设置的性能相匹配,同时提高了挂钟效率。它提供了一种令人惊讶的简单而有效的可扩展 MoE 训练路径,保留了大型专家池的优势,同时减少了训练时间和 GPU 成本。