论文

相同的架构,不同的容量:优化器引发的频谱缩放定律

Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws

模型评测模型行为与机制分析

摘要

缩放法则使语言模型的性能可以根据模型大小、数据和计算进行预测,但它们通常将优化器视为固定的训练细节。我们表明,这种假设错过了表示缩放的基本轴:优化器如何有效地将添加的 FFN 宽度转换为已利用的频谱容量。使用通过软和硬谱等级测量的前馈网络表示的特征谱,我们发现 \emph{当使用不同的优化器进行训练时,相同的 Transformer 架构实现了明显不同的谱缩放法则}。保持架构和宽度计划固定,AdamW 在已知学习最难的稀有词元 (TAIL) 表示上表现出较弱的硬秩缩放 ($β$=0.44),而 Muon 在相同的机制中实现了线性缩放 ($β$=1.02),缩放指数增加了 $2.3\times$。这种差异不能简化为验证损失:AdamW 配置可以在扩展训练下匹配困惑度中的低秩 Dion 变体,同时表现出截然不同的光谱几何形状,证明匹配的损失并不意味着匹配的表示结构。硬-软等级不对称进一步表明,优化器不仅在实现的容量上有所不同,而且在如何跨特征模态构建该容量方面也有所不同。为了将优化器效应与架构效应区分开来,我们与架构干预(例如,注意力等级和位置编码)进行比较,发现优化器引起的频谱偏移通常超过架构效应。这些结果表明优化是表示缩放的一流轴,激励优化器-架构协同设计。