论文
每个参数的词元覆盖率对于稳健的 LLM 缩放定律外推至关重要
Tokens-per-Parameter Coverage Is Critical for Robust LLM Scaling Law Extrapolation
摘要
神经缩放定律将语言模型的损失近似为参数计数 $N$ 和标记计数 $D$ 的幂律函数。在 Chinchilla 式的计算优化训练之后,许多研究都根据在固定的每参数标记 (TPP) 比率 $k$ 下执行的运行来拟合缩放法则,并设置 $D = kN$。我们证明,这种共线设计,与控制 $N$ 和 $D$ 的指数在经验上常见的接近相等相结合,在高斯-牛顿最小二乘问题中引起了固有的病态:设计的条件数随着 $N$ 和 $D$ 指数之间差距的平方反比而增长。尺度系数变得几乎无法识别,置信区间膨胀一个数量级或更多,产生一个“草率”的模型,其外推法在训练射线上急剧退化。我们用四种标度律形式证明了这一点,并得出了一个封闭形式的 TPP 多样性阈值,该阈值对于条件良好的估计来说是必要且充分的。根据经验,非共线设计在保留分割上的表现优于共线设计,在四个定律、五个语料库、多个浮点精度模式下的获胜率为 97.3%。我们进一步表明,简并性植根于雅可比几何,而不是损失函数的产物:任何曲率涉及雅可比的平滑估计目标都会继承相同的病态条件。