论文
Muon 比 Adam 学到了更多稳健和可转移的特征
Muon Learns More Robust and Transferable Features than Adam
摘要
Muon 最近成为预训练 大语言模型 (LLM) 和视觉分类器的最先进的优化器。尽管 Muon 的效率优于 Adam 和 SGD,但其特征学习优势仍不清楚。本文从鲁棒性和可迁移性的角度研究了 Muon 的特征学习优势。首先,通过评估损坏图像和文本上的预训练模型,我们发现 Muon 学习到的特征始终比 Adam 和 SGD 在不同架构(包括 Transformer 和卷积神经网络 (CNN))中学习到的特征更加稳健。使用训练有素的逐层探针,我们进一步表明,这种鲁棒性优势反映在更大的跨层 logits 裕度中。其次,通过在下游任务上使用预训练参数训练线性分类器或 微调 完整模型,我们证明 Muon 学习的特征比 Adam 和 SGD 学习的特征转移更有效。这种可转移性优势得到了跨层隐藏状态多样性的进一步支持(通过有效秩来衡量)。最后,在具有多分量特征的代表性分类问题中,我们证明了 Muon 比 Adam 和 SGD 获得了更大的裕度和更高的有效秩,为我们的实证结果提供了理论支持。