论文
自适应批量与无界方差视角
Why Does Adaptive Batching Help LLM Pretraining? A Perspective from Unbounded Variance
摘要
训练中增大批量是LLM预训练的常见做法,但其成功的理论依据尚不清楚。随机优化分析常假设随机梯度方差一致有界,而近期证据表明该假设在许多实际非凸问题中失效。Blum-Gladyshev(BG-0)噪声模型放松该假设,允许方差随离初始化距离二次增长,提示批量调度器可通过控制训练中的方差增长发挥作用。但实践中这种增长可能过于保守。我们实证研究LLM预训练中的方差增长,观察到带可调增长指数的广义BG模型能更紧致地描述实际噪声行为;据此提出广义BG-a噪声模型,在有界方差(a=0)与BG-0噪声(a=2)间插值。在L光滑性下,我们导出增长相关的信息论下界Ω(ε^{-(4+a)}),并通过随迭代远离初始化增大批量建立ε依赖上界匹配。最后提出通过动态批量调整控制方差增长的自适应批量调度器:在C4上预训练至多1B参数的OLMo2时,相同token预算下验证损失低于小批量与大批量训练,且迭代次数少于小批量训练的10%。