论文

NormPre:先归一化、再预条件化的大语言模型优化方法

Normalize-Then-Precondition: A Hierarchical Approach to Marginal Scale and Interaction Geometry for LLM Training

模型训练预训练

摘要

矩阵优化器已成为一个有前途的方向,其中 Muon 成为一个突出的设计。通过其全 Gram 表示重新审视 Muon,我们观察到它联合处理边际尺度和交互信息。这开辟了一种分层组织几何信息的替代方法,从而激发了规范化然后前提条件框架。具体来说,它首先使用对角线格拉姆信息来构造边际归一化更新,然后将谱预条件化应用于其定向相互作用几何。在此框架的基础上,我们开发了 NormPre,其中 NormPre-G 和 NormPre-L 采用全局和局部谱预条件化,分别基于谱范数最速下降和正则化公式,然后进行领先模式选择。为了实现大规模训练,NormPre-G 使用 Newton-Schulz 迭代,NormPre-L 使用随机草图来近似主要交互特征空间。理论上,我们为 NormPre 的简化版本建立 $\mathcal{O}(T^{-1/2})$ 收敛保证。在 GPT-2 Small、LLaMA 和 Qwen3 上进行的广泛预训练实验中,两种变体在匹配的训练预算下始终优于 AdamW、Muon 和 MANO。进一步的效率和频谱分析揭示了两种变体的互补优势,并描述了它们的性能-效率权衡。我们通过位于 https://github.com/zx-gong/NormPre. 的 GitHub 存储库开源我们的代码