论文
大规模预训练该如何设置学习率?
How to Set the Learning Rate for Large-Scale Pre-training?
摘要
学习率(LR)的最优配置是大规模预训练中一项基础却艰巨的挑战。鉴于训练成本与模型性能之间的严格权衡,关键问题在于能否从低成本实验中准确外推最优学习率。本文将这一研究形式化为两种不同的研究范式:拟合(Fitting)与迁移(Transfer)。在拟合范式内,我们创新性地为搜索因子引入一条Scaling Law,通过预测建模将搜索复杂度从O(n^3)有效降至O(n*C_D*C_η)。在迁移范式内,我们将μTransfer的原理扩展到混合专家(MoE)架构,把其适用范围拓宽到涵盖模型深度、权重衰减和token视界。通过在规模上推进现有超参数研究的边界,我们对这两种范式进行了全面比较。我们的实证结果对被广泛采用的μTransfer在大规模预训练场景中的可扩展性提出质疑。此外,我们通过训练稳定性与特征学习双重视角进行严格分析,阐明模块级参数调优在大规模设置下表现不佳的深层原因。这项工作为优化工业级预训练提供了系统的实践指南与新的理论视角。
