论文
摊销比例法建设成本
Amortizing Scaling Law Construction Costs
摘要
缩放定律指导训练大型基础模型的设计选择,但推导它们涉及在超参数、词元预算 和参数计数上训练详尽的网格,这在计算上是昂贵的。然而,拟合缩放法则只需要跨计算尺度的最佳损失边界,丢弃大多数训练的配置。我们提出了一个有效的标度律构建框架,将数据收集表示为贝叶斯优化问题,并引入了用于在受限计算预算下比较标度律拟合方法的指标。我们发现,在获取过程中逐步扩大计算预算,反映实践中配置的计算顺序评估,可以显着提高恢复效率。通过替代幻想评估来增强观察到的配置,然后恢复更广泛的实验网格,从而无需训练每个配置即可实现精确的缩放定律拟合。总之,这些可以紧密匹配整个密集网格上的缩放定律,节省的计算量高达 $10\text{--}100\times$。