论文
专家升级改造:改变专家混合的计算效率前沿
Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts
摘要
专家混合 (MoE) 已成为扩展 大语言模型 的主要架构:前沿模型通常通过稀疏专家路由将总参数与每个词元计算解耦。缩放定律表明,在固定的主动计算下,模型质量可预测地随总参数缩放,而 MoE 通过增加专家数量来实现这一点。然而,训练大型 MoE 的成本很高,因为内存需求和设备间通信都会随着参数总数的变化而变化。我们提出专家升级,这是一种通过在持续的 预训练 (CPT) 期间增加专家数量来逐步扩大 MoE 能力的方法。给定训练有素的 E-专家模型,升级操作员通过专家复制和路由器扩展构建 mE-专家模型,同时保持 top-K 路由固定,从而保留每个词元的推理成本。复制提供了热初始化:扩展模型继承了源检查点的学习表示,从比随机初始化低得多的损失开始。随后的 CPT 打破了重复专家之间的对称性,以推动专业化。我们形式化了升级回收算子,并开发了一个理论框架,将质量差距分解为容量项和初始化项。我们进一步引入了基于效用的专家选择,它使用基于梯度的重要性得分来指导非均匀重复,当 CPT 有限时,其差距闭合程度超过三倍。在我们的 7B-13B 总参数实验中,升级后的模型与验证损失的固定大小基线相匹配,同时节省了 32% 的 GPU 时间。跨模型规模、激活率、MoE 架构和训练预算的全面消融产生了部署专家升级的实用方法,将其确立为从头开始训练大型 MoE 模型的有原则的、计算高效的替代方案。