论文

LLM预训练中从Spectra到联合调度:3+3(+2)缩放法则制度

From Spectra to Joint Schedules in LLM Pre-training: 3+3(+2) Scaling-Law Regimes

模型训练预训练

摘要

尽管学习率和批量大小计划可以改变观察到的损失,但幂律学习曲线通常被视为模型及其数据的固定属性。我们研究了具有线性随机特征的噪声在线 SGD 中的这种依赖性。以表示为条件,精确的 Volterra 方程将两个响应分量分开:传播未解决的目标错误的强制项和传播随机错误注入的内存内核。我们证明,当且仅当其累积加权谱质量具有相应的低谱标度时,任一分量都遵循幂律;各个特征值和目标系数不需要遵守坐标幂律。在联合调度下,固有时间 $T_t=\sum_{s<t}η_s$ 控制优化进度,而 $r_t=B_t/η_t$ 控制噪声注入。它们的相互作用产生了尖锐的条件,在这种条件下,调度保留、改变或破坏清洁电力定律,以及减少噪音的记忆上限。幂律随机特征模型在 $3+3(+2)$ 传播机制中以依赖于相位的计算速率实现了这种机制。受控的 nanoGPT 实验表明,(1) 具有匹配的 $B/η$ 路径的学习率和批量大小计划在内在时间上几乎是等效的,(2) 强制记忆代理准确地预测了计划中的损失,(3) 它在现实世界数据集中的拟合指数确定了 $3+3(+2)$ 地图中的 LLM 的状态。