论文

依赖于优化器的训练动态收敛到相同的三分之一最佳数据缩放

Optimizer-dependent training dynamics converge to the same one-third optimal data scaling

模型评测模型行为与机制分析

摘要

神经缩放(其中损失随着训练的幂律而下降)是大语言模型的核心,最近的一项提议是通过学习峰值分布来产生 1/3$ 指数。该帐户描述了 SGD,但实践中的模型是使用自适应优化器进行训练的。在这里,我们将 $1/3$ 帐户不区分的两个指数分开:随着单次运行的训练步骤损失下降的速度,以及优化调整的损失随着数据集大小 $D$ 下降的速度。我们表明,第一个(动态指数)是特定于优化器的,而第二个(最佳数据指数)在优化器之间收敛到 $1/3$。在在线师生模型中,我们将损失分解为范数增长(径向)和与教师方向的对齐(切向),每个损失都以动态指数 $α_{r}$ 和 $α_{t}$ 的幂律衰减。在 SGD 下,两者都接近 $1/3$,因此不同学习率下的数据指数也是 $1/3$。在 Adam 下,两者分开:$α_{r} \simeq 0.48$,但 $α_{t} \simeq 0.08$。由于当这两部分平衡时总损失最小化,因此最佳学习率取决于优化器:对于 SGD,$D$ 独立,但对于 Adam,则随 $D$ 下降。然而,调整到最佳值后,两者的损失都会返回到 $D^{-1/3}$。随机动力学分析解释了原因:优化器可以在两个通道之间交换衰减速度,但它们都落在单个动态指数关系 $2α_{r}+ α_{t} = 1$ 上,它将最佳数据指数固定为 $1/3$。在包括 Muon 在内的七个优化器中,测量的指数与此关系一致,并且最佳损失包络与它们之间的 $D^{-1/3}$ 一致。优化器设置模型每一步学习的速度;经过优化调整,它会改变前因子,但不会改变每个样本损失下降的速率。