论文
稀疏层对于扩展循环语言模型至关重要
Sparse Layers are Critical to Scaling Looped Language Models
摘要
循环语言模型通过深度重复一组 Transformer 层,从而降低内存成本并在循环边界提供自然的提前退出点。然而,循环模型的扩展性不如具有独特层的标准 Transformer。我们比较了标准和专家混合 (MoE) Transformer(有循环和没有循环),并发现两个主要结果。首先,我们发现 Looped-MoE 模型的伸缩性比标准基线更好,而密集循环模型则不然。我们将其追溯到循环之间的路由分歧:在 Looped-MoE 模型中,每次通过相同共享层时都会激活不同的专家,无需额外参数即可恢复表达能力。我们的第二个发现是,循环模型比标准模型具有更好的计算质量权衡和提前退出。由于每个循环都以产生最终输出的相同层结束,因此循环边界是优越的退出点,正如这些点的早期输出收敛所证实的那样。总之,我们为扩展循环模型提供了明确的方向:具有早期退出的 Looped-MoE 模型不仅可以在规模上击败标准 Transformer,而且还可以在质量下降最小的情况下显着节省内存和推理。