论文
数据受限训练的规定缩放定律
Prescriptive Scaling Laws for Data Constrained Training
摘要
训练计算的速度日益超过高质量数据的可用性。这将核心挑战从最佳计算分配转移到从有限数据中提取最大价值。广泛采用的 Chinchilla 缩放法则假设每个训练词元都是唯一的。这限制了它在数据受限的情况下指导预训练决策的能力。我们使用简单的加性过拟合惩罚对重复下的超额损失进行建模,并发现它准确地描述了模型行为。我们的缩放定律产生了全新的计算最优分配建议。超过某一点,进一步的重复会适得其反,计算最好花在模型容量上。我们表明,遵循法律推荐的配置可以提高数据受限情况下的性能。最后,由于我们的单参数形式隔离了单个系数的过度拟合,因此它可以跨训练配置进行直接比较。作为一个案例研究,我们表明,强烈的权重衰减 ($λ=1.0$) 使该系数降低了大约 70%,为最近的发现提供了比例律解释,即数据受限制度中的最佳权重衰减比标准实践大一个数量级。