论文
使用链式 LMO 优化大型语言模型
Optimizing Large Language Models with Chained LMOs
摘要
Muon 推动了越来越多的优化器家族不断壮大,这些优化器组成了多个矩阵归一化,但这些方法仍然分散且缺乏统一的视角。我们引入了链式线性最小化预言机(链式 LMO),它将这些方法视为 LMO 的组合。尽管它们在实证上取得了成功,但许多链都超出了标准 LMO 框架,并且可能在平滑凸目标上出现分歧。为了解释为什么组合仍然有帮助,我们转向线性联想记忆,并表明在各向异性嵌入下链接可以比 Muon 有所改进。根据经验,我们提出 TensorChain,这是框架内的一种新型优化器,可跨不同层堆叠兼容的权重矩阵,并跨其轴标准化 3d 张量。在 Qwen3 0.6B 和 1.7B 预训练中,TensorChain 在平均token效率方面优于所有链式基线,在匹配验证损失的情况下,比 Muon 平均节省token 9.6%。