阶梯定律能否转移到小规模语言模型?低于 59M 参数的经验重新校准
Does Step Law Transfer to Small-Scale Language Models? An Empirical Recalibration Below 59M Parameters
摘要
Step Law 给出了预训练语言模型时最佳峰值学习率 eta* 和批量大小 B* 的幂律公式。在59M和1B参数之间的模型上进行了校准;小模型体系 N < 59M 从未被其作者进行过实证测试。这种机制对于单 GPU 训练、可解释性研究、教育实验以及因内存或成本原因而无法使用较大模型的环境很重要。我们测试 Step Law 是否可以迁移到小语言模型。我们考虑三个结果:H1,原始系数直接起作用; H2,幂律形式成立,但系数不同;和 H3,幂律没有描述该机制中的最优值。所有实验均使用单个 nanoGPT/TinyStories 管道,其中包含 2048 个词元的 BPE 词汇、AdamW 和预热余弦计划。每个 (N, D) 单元的最优值是通过平滑训练损失上的双对数坐标中的局部二次近似从损失表面 L(eta, B) 中提取的。最终数据集包含 29 个独特的(N、D)细胞和 935 次分析就绪运行。主要改装在工作范围 4 <= D/N <= 600 中使用 25 个单元(815 次运行)。在汇总数据上,我们接受 H2:保留函数形式,但系数与原始系数不同。我们得到 eta*(N, D) = 0.0985 N^(-0.508) D^(0.238) (R^2 = 0.834) 和 B*(D) = 3.6 x 10^(-4) D^(0.931) (R^2 = 0.950)。 Step Law 的结构主张 B* 独立于 N 被重现 (p = 0.87),但 B* 随 D 的增长几乎是原始工作中的两倍。 Step Law 的直接迁移系统性地高估了最优学习率:中位数比率 eta_SL / eta* 约为 4.0x,范围为 2.4x 至 6.6x。