论文
你的优化器在乎你如何归一化吗?LLM训练中的归一化-优化器耦合
Does Your Optimizer Care How You Normalize? Normalization-Optimizer Coupling in LLM Training
摘要
在LLM训练中,归一化层与优化器通常被视为相互独立的设计选择。在1B参数、1000训练步的3x2因子实验中,我们证明这一假设可能失效:Dynamic Erf(Derf;Chen & Liu, 2025)与Muon(Jordan, 2024)之间存在大幅负向交互,其与RMSNorm的差距从AdamW下的+0.31 nats扩大到Muon下的+0.97,约为原来的三倍。作为有界归一化器对照纳入的Dynamic Tanh(DyT;Zhu et al., 2025)则没有这种代价。我们的证据指向erf在Muon更快谱范数增长下的两种失效模式:饱和(有损压缩)与尺度盲视(丢弃激活幅值)。一种重新引入运行时尺度估计的EMA混合方法可挽回约84%的差距。另外,将Derf的alpha从已发表默认值下调(0.5至0.3),使erf保持在近线性区间——在该区间它近似保持相对尺度——从而挽回约80%的差距;这一设置并非Chen & Liu(2025)发表的默认值。将Derf已发表的默认alpha与Muon搭配使用会带来0.66 nat的交互损失,且不会产生NaN或发散,使得这一失效在短程试点实验中很容易被漏掉。