论文
混合专家的泛化和缩放定律 Transformer
Generalization and Scaling Laws for Mixture-of-Experts Transformers
摘要
我们为混合专家(MoE)Transformer 开发了一种泛化和扩展理论,该理论将 \emph{active} 每个输入容量与路由组合完全分开。通过对固定路由模式和它们之间的联合边界进行调节,我们得出了一个超范数覆盖数边界,其度量熵与活动参数预算成比例,并产生 MoE 特定的路由开销。结合平方损失的标准 ERM 分析,这会在 $d$ 维流形数据模型和 $C^β$ 目标下产生泛化界限,表明一旦适当考虑了活动参数,近似和估计就会像在密集网络中一样进行权衡。我们进一步证明了 MoE 架构的建设性近似定理,表明在近似构造下,可以通过扩展活动容量或增加专家数量来减少误差,具体取决于主要瓶颈。从这些结果中,我们得出模型大小、数据大小和计算最佳权衡的神经缩放定律。总的来说,我们的结果为 MoE 扩展的推理提供了一个透明的统计参考点,阐明了哪些行为得到了最坏情况理论的认证,哪些行为必须来自于数据依赖的路由结构或优化动态。