论文
揭示 LLM 中的模块化梯度噪声不平衡:通过信噪比校准 Adam
Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio
摘要
大语言模型(LLM)令人印象深刻的性能源于其大规模和异构模块组成。然而,这种结构异质性带来了额外的优化挑战。虽然 Adam(W) 等自适应优化器提供每个参数的自适应性,但它们没有明确考虑模块级梯度异质性,从而导致收敛速度较慢、性能次优或训练不稳定。现有的方法通常依赖于手动调整的特定于模块的学习率或特定的优化策略,这些方法的计算成本很高并且难以跨任务或模型推广。为了建立更有原则的方法,我们首先分析 Adam 在高噪声模块中的噪声阻尼行为,并引入 \textbf{通过 SNR (MoLS) 进行模块学习率缩放}。 MoLS 估计模块级 SNR 以扩展 Adam 更新,从而允许自动进行模块学习率分配,无需手动调整。通过多个 LLM 训练基准的经验结果表明,MoLS 提高了收敛速度和泛化能力,实现了与精心调整的特定于模块的学习率相当的性能,同时保持与内存高效训练算法的兼容性。