论文

模型增长、递归和边界算子如何影响缩放指数

How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents

模型架构递归架构

摘要

缩放定律预测损失如何随着计算量的增加而减少。与传统观点相反,我们表明架构干预可以修改预训练中的缩放指数,从而随着计算的增加而导致性能的幂律改进。作为一个锚点,我们考虑环形Transformer的架构公式。尽管通常不以这种方式使用,但循环(也称为递归深度)通过增加训练期间的循环数量提供了模型增长的机制。无论有或没有共享权重,模型增长都会为缩放指数带来最大的变化。特别是,7.4B 模型增长架构与 CORE 上的 GPT-3 13B 相匹配,计算量减少了大约 20 倍,并且计算效率随着规模的扩大而增加。此外,简单地在普通Transformer中使用边界算子来规范化并注入较早的块,也可以提供指数增加,尽管程度较小。在数据受限的多纪元设置中,标准循环具有有用的正则化效果,我们发现随着规模的增加循环数量是计算最优的。这些结果可以通过计算深度的角度来理解:对于给定的计算预算,我们希望增加Transformer的可用深度,这可以导致效率增益随着规模的增加而增加。