论文

MuCon:LLM 训练的剪辑 Muon 更新

MuCon: Clipped Muon Updates for LLM Training

模型训练预训练

摘要

Muon 式优化器采用矩阵值动量或预处理更新 $B = U \operatorname{diag}(σ_1,\ldots,σ_r) V^\top$ 并将其替换为规范的部分极因子 $\operatorname{Pol}(B) = U V^\top$。这将每个非零奇异值映射为一。 MuCon 是这里研究的裁剪 Muon 变体:它将奇异值裁剪应用于相同的 Muon 矩阵, $D^{\mathrm{MuCon}}\_τ(B) = \operatorname{MClip}\_τ(B) = U \operatorname{diag}\bigl(\min\{σ\_i,τ\}\bigr) V^\top, \qquad τ> 0$。因此, $\operatorname{MClip}\_τ$ 表示数学剪切运算符,而 MuCon 表示用此剪切方向替换 Muon 极坐标方向的优化器基元。这项工作中使用的 Muon/MuCon 缩放参数化称为 $\text{SpectralP}$:它是应用极 Muon 或剪切 MuCon 方向的隐藏矩阵缩放配方。映射 $\operatorname{MClip}\_τ$ 是谱范数球 $\{X : \|X\|_2 \le τ\}$ 上的 Frobenius 投影:它使 $τ$ 或低于 $τ$ 的奇异值保持不变,并且仅修改违反的奇异方向。本文询问什么时候可以在没有完全密集 SVD 的情况下近似 MuCon 裁剪步骤。我们记录两个精确恒等式,一个极坐标/绝对值公式和一个标量根公式,从而为截断的正半定因子提供有理牛顿滤波器,并识别两者共同的数值障碍:阈值附近的奇异值使符号决策和有理解成为病态的。因此,矩阵函数方法仅在与稳定的极坐标/平方根原语或裁剪边界附近的显式正则化配对时才有用。