论文

OrScale:具有分层信任比缩放的正交优化

OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling

模型训练预训练

摘要

Muon 将每个矩阵值更新的 emph{方向} 固定在其动量的极坐标因子上,而每层的步长 emph{幅度} 仅通过静态形状校正来解决。我们通过将 LARS/LAMB 信任比原理适应正交化设置来导出动态的每层标量,其中候选标准分母(原始动量范数或极因子范数)要么存在于错误的单位空间中,要么不携带更新尺度信息。由此产生的方法,\emph{OrScale},使用实际应用的参数空间方向的范数,并通过每层校准将每一层的比率锚定为 1,以便 Moonlight 配方(针对 AdamW 调整,通过 RMS 匹配与 Muon 共享)以 \emph{无额外扫描} 进行传输;组件烧蚀确认每个设计选择都是单独承重的。理论上,OrScale 对于任何截断乘法器都保持核范数 $O(1/\sqrt{T})$ 收敛速度,并在可从标准训练诊断估计的两个条件下实现严格的层自适应下降增益 $κ_{\mathrm{eff}}>1$——预测增益应 \emph{随架构异质性增长} 的界限。实验证实了预测:每个超参数都从 Moonlight 配方中逐字继承,OrScale 在密集的 125M--1.1B FineWeb-Edu 预训练 上匹配或击败 Muon+Moonlight,并且在 16B-A3B 专家混合模型上(其中记录的信任比按层类别清晰地分开)差距扩大了一个数量级,达到 0.130纳特(相对 3.8%)按平价挂钟成本计算。