论文
ExpertMuon-Compass:MoE 训练的对齐引导步长
ExpertMuon-Compass: Alignment-Guided Step Sizes for Mixture-of-Experts Training
摘要
专家混合 (MoE) 语言模型将每个 token 发送给几个专家,因此每个专家都接受数据的不同部分的训练,并且该部分在训练期间发生变化。通过共享学习率,即使专家的更新与其当前的 梯度 不一致,Muon 也会将大致相同大小的更新应用于相同形状的专家矩阵。我们在这里提出ExpertMuon-Compass(Compass),它将每个专家的Muon步长乘以两个因子。族因子将专家的正交更新及其 梯度 之间的余弦与该层中其他专家的相同余弦进行比较。标量半径将更新和 梯度 的相应行之间的对齐聚合为一个步长乘数。 Compass 保留 Muon 的更新方向和动量缓冲区。在 FineWeb-Edu 上的预训练中,所有矩阵上具有 Nesterov 动量的 Compass 的表现与 Muon、NorMuon 和其他优化器一样好甚至更好,在长期运行中,权重衰减与 NorMuon 相匹配。将其因子添加到 NorMuon 会产生与 NorMuon 相同或更低的损耗。当每个专家在训练期间看到的数据各不相同时(例如,当多语言语料库的语言到达单独的块时),指南针是最有效的。使用Compass,专家负载保持平衡,路由器更果断地将token分配给专家。我们还证明了这两个因素的扰动界。