论文
Nora:可扩展矩阵优化器的归一化正交行对齐
Nora: Normalized Orthogonal Row Alignment for Scalable Matrix Optimizer
摘要
基于矩阵的优化器在训练 大语言模型 (LLM) 方面表现出了巨大的潜力,然而,设计理想的优化器仍然是一项艰巨的挑战。一个优秀的优化器必须满足三个核心需求:效率、实现类 Muon 预处理以加速优化;稳定性,严格遵守神经网络固有的尺度不变性;和速度,最大限度地减少计算开销。虽然现有方法在不同程度上解决了这些问题,但它们通常无法统一它们,要么会产生像 Muon 这样令人望而却步的计算成本,要么会出现像 RMNP 这样损害稳定性的径向抖动。为了弥补这一差距,我们提出了 Nora,这是一种严格满足所有三个要求的优化器。 Nora 通过将行动量投影到权重的正交补集上,明确稳定权重范数和角速度,从而实现训练稳定性。同时,通过利用 Transformer Hessian 的块对角优势,Nora 有效地近似结构化预处理,同时保持 $\mathcal{O}(mn)$ 的最佳计算复杂度。此外,我们证明了 Nora 是一个可扩展的优化器,并建立了其相应的扩展定理。通过仅需要两行代码的简化实现,我们的初步实验验证了 Nora 是一种高效且极具前景的大规模训练优化器。