论文

具有两阶段优化的分层专家混合

Hierarchical Mixture-of-Experts with Two-Stage Optimization

摘要

稀疏专家混合 (MoE) 模型通过将每个词元路由到一小部分专家来扩展容量。然而,他们的路由器表现出一个基本的权衡:强大的负载平衡可以抑制专家的专业化,而激进的多样性通常会导致路由崩溃。我们提出了 Hi-MoE,一个分组的 MoE 框架,它将路由控制分解为两个耦合级别:(i)在专家组之间强制执行公平流量的组间平衡,以及(ii)促进互补专家行为同时防止组内崩溃的组内专业化。我们的分析为我们的分层目标如何重塑路由器提供了原则性解释,从而促进稳定的专业化并减轻崩溃。我们观察到 NLP 和视觉基准相对于最近的稀疏路由和分组 MoE 基线的持续改进,并通过扩展研究(模型大小、专家数量)和有针对性的消融来确认鲁棒性。在 58B 词元的大规模 预训练 中,Hi-MoE-7B 在不同的评估领域中比 OLMoE-7B 实现了 5.6% 的困惑度降低和 40% 的专家平衡性提高。