论文
如何分配您的词元?通过训练步骤和批量大小缩放法则
How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size
摘要
我们提出了一种缩放法则,该法则考虑了模型大小和训练数据,同时将后者明确分为训练步骤和批量大小(称为三项法则)。将所提出的定律拟合到大量训练运行中,我们发现它正确地恢复了最佳批量大小的缩放。此外,因为它利用了次优批量大小的训练运行,所以我们提出的定律可以稳健地适应明显更少量的训练运行。我们进一步表明,三项定律可用于导出次优批量大小的缩放定律,并且它与之前与临界批量大小相关的经验结果相匹配。