论文

优化器模型一致性:使用与预训练相同的优化器进行全面微调,遗忘更少

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

模型训练监督微调与指令调优

摘要

在训练 大语言模型 (LLM) 时,优化器在预训练和微调阶段都发挥着重要作用。在本文中,我们提出了一个观察结果,即在监督微调(SFT)阶段,使用与预训练相同的优化器进行完全微调可以实现更好的学习-遗忘权衡,即在新任务上实现相同或更好性能的同时,与其他优化器以及可能令人惊讶的 LoRA 相比,遗忘更少。我们将这种现象称为优化器模型一致性。为了更好地理解它,通过受控实验和理论分析,我们表明:1)优化器可以通过对激活进行正则化影响来塑造模型,从而在预训练检查点周围产生不同的景观; 2)针对这种正则化效果,SFT中的权重更新应该遵循一些特定的结构,以减少对预训练中学到的知识的遗忘,这可以通过使用相同的优化器来获得。此外,我们特别比较了 Muon 和 AdamW 在整个预训练和 SFT 阶段的使用情况,发现 Muon 在针对推理任务进行微调时表现更差。通过合成语言建模实验,我们证明这可能来自 Muon 强烈的死记硬背倾向,这可能会损害少量数据的模式获取,就像 SFT 一样。