论文

小规模实验:我们做到了吗?

Small-Scale Experiments: Are We There Yet?

模型评测评测方法与指标

摘要

规模法则承诺进行具有成本效益的实验;六年后,他们尚未完全兑现。相反,研究人员发现它们在小规模(从 4M 参数开始)下不可靠,并得出结论,无法避免大型模型。我们证明情况并非如此:混杂因素是超参数。小模型非常敏感,但超参数敏感度会随着规模的增大而减弱。这种小规模的敏感性使得标度定律很容易被忽视,因为它们只出现在完全调谐的前沿上,而到达该前沿需要远远超出大多数以往运行的广泛搜索。通过消除基本的缩放定律配方,我们证明了经过良好调整的超参数比任何其他成分都更重要。此外,我们揭示了为什么这些超参数变得更容易找到:随着规模的增加,超参数损失表面变得更低维度。然而,虽然小型模型中存在缩放定律,但外推法会遇到统计限制。需要采取整体方法。将我们的见解与最新文献相结合,我们开发了一种以模型为中心的研究的新方法,并在该领域曾经花费数年时间解决的问题上进行了演示:在 Transformer 架构中将标准化层放置在哪里。通过小规模实验,我们恢复了大规模结果:随着模型规模的增大,预归一化效果更好。有了正确的工具和更好的理解,小规模实验可以实现缩放定律期待已久的承诺。