论文
Muon 可以微调 Adam 预训练模型吗?
Can Muon Fine-tune Adam-Pretrained Models?
摘要
Muon 已成为 Adam 预训练的有效替代方案,但在 微调 中仍未得到充分利用。一个关键障碍是,大多数开放模型都是使用 Adam 进行预训练的,并且天真地切换到 微调 的 Muon 会导致由于优化器不匹配而导致性能下降。我们通过对照实验研究了这种不匹配,并将其与 Adam 和 Muon 的独特隐性偏差联系起来。我们提供的证据表明,这种不匹配会破坏预先训练的知识,并且这种破坏会随着更新强度而扩大。这使我们假设限制更新应该减轻不匹配的情况。我们用 LoRA 验证了这一点:在语言和视觉任务中,LoRA 缩小了在完整 微调 下观察到的 Adam 和 Muon 之间的性能差距。对 LoRA 排名、灾难性遗忘和 LoRA 变体的研究进一步证实,不匹配的严重程度与更新强度相关。这些结果揭示了优化器不匹配如何影响 微调 以及如何缓解它。我们的代码可在 https://github.com/XingyuQu/muon-finetune 获取。