论文
实用的扩展法则:在数据受限的世界中将计算转化为性能
Practical Scaling Laws: Converting Compute into Performance in a Data-Constrained World
摘要
指导现代 模型训练 的缩放法则针对单一机制进行了校准:数据丰富、单周期预训练。这种占主导地位的缩放法则形式,Chinchilla 的 $L = E + A/N^α+ B/D^β$,在该体系之外具有三个结构限制:随着独特数据的缩小而发散,而不是在无信息的基线处饱和;当容量超过数据时,不能代表过拟合;它将看到的全部示例与可用的独特示例合并在一起。我们提出了一个封闭形式的扩展,$L(N, D, T) = E + (L_0 - E)\,h/(1+h)$,其中$h = a/N^α+ b/T^β+ c\,N^γ/D^δ$,将损失分解为能力不足、训练不足和过度拟合项。它在不可约损失 $E$ 和由损失类型固定的无信息基线 $L_0$ 之间饱和,并在数据丰富的单纪元限制中减少到 Chinchilla。我们在跨越视觉、科学 ML 和语言领域的四个架构系列(MLP、ResNet、傅里叶神经算子和 Transformer)的四个多时代实验中对其进行了验证,并将其重新调整为五个已发布的 LLM 缩放律网格。外推到比拟合时间更高的计算和更大的独特数据,我们的形式在我们评估的每个已发布的 LLM 网格以及我们构建的实验的大多数单元上实现了最先进的 RMSE。一旦校准,该表格就会承认成本感知的分配,当数据免费时恢复 Chinchilla 的最佳状态,并随着数据变得昂贵而转向更小的语料库和更多的纪元。