论文
重新思考可转移超球面优化下的语言模型扩展
Rethinking Language Model Scaling under Transferable Hypersphere Optimization
摘要
大语言模型 的缩放法则主要取决于优化器和参数化。现有的超参数传递律主要是为一阶优化器开发的,它们并不能从结构上防止大规模训练的不稳定。最近的超球面优化方法将权重矩阵限制为固定范数超球面,为更稳定的缩放提供了一种有希望的替代方案。我们引入了 HyperP(超球参数化),这是第一个在 Frobenius 球约束下使用 Muon 优化器跨模型宽度、深度、训练标记和专家混合 (MoE) 粒度传输最佳学习率的框架。我们证明权重衰减是 Frobenius 球体上的一阶无操作,表明 Depth-$μ$P 仍然是必要的,并发现最佳学习率遵循与先前在 AdamW 中观察到的“神奇指数”0.32 相同的数据缩放幂律。在 HyperP 下的所有计算预算中以最小规模调整的单一基础学习率,在 $6\times10^{21}$ FLOPs 的强大 Muon 基线上产生 $1.58\times$ 计算效率。此外,HyperP 提供可转移的稳定性:所有监控的不稳定指标,包括 $Z$ 值、输出 RMS 和激活异常值,在训练 FLOP 缩放下保持有界且不增加。我们还提出了 SqrtGate,一种源自超球面约束的 MoE 门控机制,可保留跨 MoE 粒度的输出 RMS,以改进粒度缩放,并表明超球面优化可实现更大的辅助负载平衡权重,从而产生强大的性能和良好的专家平衡。我们在 https://github.com/microsoft/ArchScale 发布了我们的训练代码库。