论文
平滑的扩容法则隐藏了逐步的词元学习
Smooth Scaling Laws Hide Stepwise Token Learning
摘要
语言模型损失遵循模型和数据大小的非常规则的缩放定律,但仍不清楚为什么总损失应该呈现幂律形式。现有的解释通常将这种规律性归因于自然语言中模式难度的重尾谱,但这种观点尚未在大规模真实数据训练中的 词元级 粒度上得到直接验证。我们提出了一个 词元级 框架,该框架将缩放法则分解为各个上下文标记的本地化学习事件。通过用 sigmoid 拟合 token 损失轨迹,我们表明 token 学习集中在局部转换中,从而产生了主导缩放律形状的学习时间谱。一百多个 预训练 在具有现代 LLM 架构的大型且多样化的真实语言语料库上运行,扩展到 6B 个参数和 300B 个训练标记,测量的学习时间谱沿训练步骤 $T$、数据规模 $D$ 和模型规模 $M$ 轴定量重建验证损失导数。我们进一步表明,相同的信号是可操作的:通过根据词元何时变得可学习来重塑训练分布,我们改变了优化轨迹,并实现了 11% 的更快验证损失减少。这些结果提供了直接的经验证据,表明缩放法则主要受 词元级 学习时间分布的控制,并且该分布不仅可以用来解释缩放行为,还可以用来提高训练性能。