论文

切片和切块:配置专家的最佳组合

Slicing and Dicing: Configuring Optimal Mixtures of Experts

摘要

专家混合 (MoE) 架构已成为 大语言模型 的标准,但其许多核心设计选择 - 专家计数、粒度、共享专家、负载平衡、词元丢弃 - 仅在狭窄的配置范围内一次研究一两个。这些选择是否可以在不考虑交互的情况下独立优化仍然是一个悬而未决的问题。我们首次对超过 2,000 次预训练运行进行了系统研究,涵盖总参数高达 6.6B 的模型,其中我们详尽地改变了总专家数、专家维度、单层内的异构专家大小、共享专家大小和负载平衡机制。我们发现,在我们研究的每个活跃参数规模中,即使在极端的活跃专家参数比率(例如 128)下,性能也会随着 MoE 总参数的增加而不断提高。此外,最佳专家规模几乎与总参数计数无关,并且仅取决于活跃参数计数。第三,我们看到共享专家、异构专家和负载平衡设置等其他选择相对于专家数量和粒度的影响很小,尽管无丢包路由产生了一致的增益。总的来说,我们的结果提出了一个更简单的方法:专注于专家数量和粒度,其他选择对最终质量的影响最小。