论文

$φ$-混合专家训练的平衡

$φ$-Balancing for Mixture-of-Experts Training

摘要

专家混合 (MoE) 模型依靠均衡的专家利用来充分实现其可扩展性。然而,现有的负载平衡方法很大程度上是启发式的,并且基于嘈杂的小批量分配统计数据进行操作,从而引入了相对于总体水平目标的偏差。我们提出$φ$-balancing,这是一个原则框架,通过最小化预期路由分布的严格凸、对称和可微的潜力,直接针对群体水平的专家平衡。利用凸对偶性,我们推导出等效的最小-最大公式,并通过镜像下降获得简单的在线算法,从而产生有效的基于 EMA 的路由调整,且开销可以忽略不计。在大规模预训练和下游 微调 中,$φ$ 平衡始终优于之前的 Switch 式和无损基线,证明了更稳定和有效的专家利用率。