论文
SMELT:计算匹配 MoE 循环 Transformer 的缩放定律
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
摘要
循环 Transformer 通过迭代共享层块来增加有效深度,但大多数评估都是在固定模型大小下进行比较,将架构优势与额外的 FLOP 混为一谈。我们研究 Mixture-of-Experts Transformer 上的循环,同时紧密匹配每个词元的 FLOP、总非嵌入参数和 KV 缓存。通过一系列的消融,我们得到了一个称为 SMELT(稀疏 MoE Transformer,中间层循环两次)的配方,它循环中间一半层两次,同时在所有三个预算上匹配未循环的基线。我们将 SMELT 扩展到四种尺寸,最高可达 54B 非嵌入参数,并为每个架构拟合单独的 Chinchilla 式缩放法则。 SMELT 的损失随着计算的增加而下降得更快,在计算最优边界上节省了 6.8--18.0\% 的训练 FLOP。这种优势转移到下游基准,超出了验证损失的预测,在代码上是最大的,并且随着样本长度和上下文示例的数量而增长。机制分析表明,第二次访问减少了注意力集中,并将大量注意力转向与内容相关的标记,这是一种归纳偏差,可能是观察到的性能增益的基础。这些结果表明,即使在预算匹配的情况下,循环也可以改进 Transformer,从而提供了将深度重用转化为可衡量的收益的实用方法。