论文

Complete-muE:MoE 模型的最佳超参数传输和扩展

Complete-muE: Optimal Hyperparameter Transfer and Scaling for MoE Models

模型训练预训练

摘要

我们提出了 Complete-muE,一个框架,其目标是跨密集 FFN 和 Transformer 块中的任何专家混合 (MoE) 设置进行超参数传输。 $μ$P(需要固定架构)或 SDE(需要固定每步词元计数)等现有工具无法直接解决 MoE 设置中的超参数传输问题,因为密集到 MoE 传输或 MoE 总专家扩展会改变每个专家的架构和词元。 Complete-muE 通过双桥系统解决了这一挑战:Bridge~I 通过具有标准化路由器比例的活动宽度 $μ$P 在密集 FFN 和密集 MoE 之间进行映射。 Bridge~II 通过激活专家缩放在密集 MoE 和稀疏 MoE 之间进行映射,其中一阶 SDE LR/WD 校正取消,同时保留有界残差 $σ_0$ 偏移。由此产生的传输规则,我们称之为完整的 muE,涵盖了 MoE 模型的激活专家、总容量、粒度和共享/组平衡混合的变化,以及一般 Transformer 模型的网络宽度/深度、批量大小和持续时间的变化。广泛的语言模型和扩散模型预训练实验证实,完整的 muE 在模型架构和参数计数上产生相对稳定的超参数最优值,只有很小的漂移,与 Bridge~II 的非严格 SDE 行为一致。在实践中,这种漂移足够小,以至于在单个密集参考上调整的超参数可以近乎最佳地传输到所有 MoE 配置 - \emph{一次调整密集,传输到所有}是 Complete-muE 核心的实用配方。这使得 MoE 模型在扩展模型容量时能够比密集模型实现更快的收敛速度,而无需昂贵的超参数搜索。