论文
AMO:算子级自适应μ子正交化
AMO: Operator-level Adaptive Muon Orthogonalization
摘要
Muon 最近成为 AdamW 的有竞争力的替代品,用于大规模 预训练,通过 Newton-Schulz (NS) 迭代进行正交化作为其核心操作。标准 Muon 对所有参数矩阵应用统一的 NS 调度,忽略了正交化难度可能存在的差异及其对性能的影响。通过系统的实证研究,我们表明,每个矩阵的异质性是普遍存在的,并且与矩阵几何形状密切相关,矩阵几何形状随着算子类型、训练阶段和网络深度的不同而动态演变。因此,统一的 NS 计划可能会导致整个模型的正交化质量不均匀。受这些发现的启发,我们提出了算子级自适应 Muon 正交化(AMO),这是一种观察然后提交的方法,在训练早期按算子类型测量权重几何,然后使用这些信号为剩余的训练分配 NS 预算。 AMO 在标准、延长和连续 预训练 上比统一调度 Muon 提供了一致的改进,在 12 项评估任务的平均下游性能中,在 Llama3.1-1.4B 上超过最强基线 +0.76,在 Qwen3-1.7B 上超过最强基线 +0.51,并且在 Llama3.1-4B 规模上持续获得收益。