论文

μ 子的各向同性保持光谱上限:理论和三个案例研究

An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies

模型评测模型行为与机制分析

摘要

Muon 和相关的矩阵符号优化器越来越多地用于预训练 大语言模型,但它们对各个权重矩阵的内部几何结构的影响尚不清楚。这份初步报告提出了一个建立在单一理想化假设基础上的统一框架——权重重新缩放下损失的精确尺度不变性,这在归一化重的网络中大约成立。在此假设下,普通 SGD 带有内置 1/||W||对其更新大小进行制动,而 Muon 的矩阵符号步骤消除了该制动,因此 Frobenius 和谱范数向外漂移得更快(t^{1/2} 与 t^{1/4})。我们进一步观察到谱范数扰动具有非负二阶项。这意味着轻量级的“谱帽”(仅从每次更新中投影出单个顶部奇异方向的一阶增长)可以控制输出协方差 W K_X W^T 而无需冻结训练:权重通过非顶部方向、顶部方向旋转和顶部切换不断学习。我们将此上限与奇异值谱的最小熵(H-无穷大)联系起来。然后,我们研究了用 Muon 训练的三个系统:nanoGPT 前馈投影、64 专家混合专家路由器以及 bf16 FlashAttention 块的查询/键投影。在每种情况下,上限都会增加各向同性,并且在边缘(路由器崩溃为单个专家,以及一个注意力头的近乎发散)可以防止具体故障,同时使验证损失基本不变。我们强调,尺度不变性假设是强有力的,并且这些小尺度结果是初步的;欢迎评论。