论文
分布鲁棒的混合专家训练
Distributionally Robust Mixture-of-Experts Training
摘要
混合专家 (MoE) Transformer通过为每个 token 仅激活少数专家来扩展容量,但这种稀疏性会产生隐藏的可靠性问题:当路由不完善时,负载平衡模型可能会将 token 发送给未对指定输入进行充分培训的专家。我们提出分布式鲁棒 MoE 训练 (DRMoET),这是一个嵌入式目标,将分层专家视为内生鲁棒性群体,并优化高损耗路由结果,而不仅仅是均衡流量。 DRMoET 通过基于 EMA 平滑、激活加权专家损失的熵正则化 softmax 规则更新每层专家分布,增强合理的非顶部路由路径,同时保留标准 MoE 计算。在总规模为 746M 和总规模为 10.3B 的 FLAME-MoE 配方下,DRMoET 比标准 FLAME-MoE 和辅助无损耗平衡提高了下游平均值。在总参数和 67B 训练 token 上,DRMoET 将七任务平均值从 0.6625 提高到 0.6767,而辅助无损基线达到 0.6431。机制分析显示,专家损失方差较低,平均损失几乎不变,在强制中 $k$ 错误路由下,超额损失降低 4.3%,并且领域专家专业化得到改善。这些结果将路由稳健性(不仅仅是利用率平衡)定位为可靠稀疏 MoE 扩展的实际目标。项目页面和代码可在以下位置获取:https://drmoet.github.io/.
