论文

专家循环混合的缩放定律

Scaling Laws for Looped Mixture of Experts

模型训练预训练

摘要

循环Transformer和专家混合 (MoE) 提供了有效扩展的补充途径:循环增加了固定参数下的计算深度,而 MoE 稀疏性则扩展了固定活动计算下的总容量。然而现有的缩放定律是孤立地模拟重复性或稀疏性的。在这项工作中,我们引入了循环缩放定律,这是第一个与模型大小和数据一起联合建模重复性和稀疏性的缩放定律。其核心是有界的稀疏条件递归映射,它描述了循环的有效参数增益以及稀疏性如何提高该增益。这些定律比先前的替代方案更准确地预测循环模型的保留损失,并恢复标准密集和 MoE 缩放定律作为特殊情况。除了预测之外,拟合定律还为在计算和内存限制下设计循环 MoE 模型提供了原则基础。下游评估进一步证明了两个轴的互补优势:稀疏性提供约 3 倍的主动参数效率,递归产生约 2 倍的总参数推理效率,而联合扩展则进一步提升了性能前沿。作为一个实际的扩展,我们展示了这些收益在万亿词元规模上的保持:在匹配的训练计算中,具有法则派生递归的循环 MoE 在推理基准上与大约 2 倍大的非循环 MoE 相匹配,同时通过递归实现测试时计算扩展。