论文

专家路由的三个阶段:负载平衡在专家混合训练期间如何演变

Three Phases of Expert Routing: How Load Balance Evolves During Mixture-of-Experts Training

模型评测模型行为与机制分析

摘要

我们将专家混合 (MoE) 词元路由建模为具有单个有效参数(拥塞系数 gamma_eff)的拥塞游戏,该参数可量化平衡质量权衡。跟踪两个开源 MoE 模型 OLMoE-1B-7B(20 个检查点,在浪涌区域进行密集采样)和 OpenMoE-8B(6 个检查点)的训练检查点的 gamma_eff,揭示了一个三阶段轨迹:路由器学习平衡负载的浪涌阶段(gamma_eff:14 到 36-39,在步骤 30K-40K 区域达到峰值),专家专门研究的稳定阶段稳定平衡(B_0:2.4 到 2.3,步骤 100K-400K),以及松弛阶段,其中路由器根据专家的区分以平衡换取质量(gamma_eff:27 到 9,步骤 400K-1.2M)。这种非单调轨迹对于融合模型的事后分析来说是不可见的,它揭示了早期的 MoE 训练优先考虑平衡,而后期的训练优先考虑质量。理论框架诚实地表达了其局限性:单一类型平衡简化为温度缩放的 softmax(保留 L1:MFG = 0.199 与 softmax = 0.200)。游戏并不是一个更好的预测器,而是一个更好的预测器。它揭示了温度的含义,以及更重要的是,温度是如何演变的。我们通过有效的拥塞分解、通过所有 16 层上的词元聚类改进负载预测的多类型扩展(平均值:30%)、范围诊断(K/M、epsilon_l)以及四个独立质量估计器的鲁棒性验证(r >= 0.89)来补充动态。所有置信区间均来自 50 多个独立文本批次的引导重采样。