论文

Nexus:相同的预训练损失,通过共同最小值实现更好的下游泛化

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima

模型训练预训练

摘要

大语言模型 的基本功能是在互联网规模的高度异构数据混合的预训练过程中获得的。在这项工作中,我们研究了一个关于预训练收敛状态的有趣几何问题:模型是否收敛到所有数据源的公共最小化器(例如,\cref{fig:cwa_illustration:close}),或者仅仅是总损失的最小化器(例如,\cref{fig:cwa_illustration:distant})?我们假设特定任务最小值的几何“接近度”与下游泛化有内在联系。我们发现标准优化器(例如 AdamW)通常会收敛到特定任务最小值彼此远离的点。为了解决这个问题,我们提出了 Nexus 优化器,它通过在优化期间最大化梯度相似性来鼓励这些最小值的接近。从 130M 到 3B 参数、各种数据混合和超参数计划的模型实验表明,尽管 \textit{实现了相同的预训练损失},但 Nexus \textit{显着提高了下游性能}(参见 \cref{fig:demo:benchmark})。值得注意的是,在 3B 模型上,Nexus 将分布外损失减少了 0.012,并且在复杂推理任务(例如 GSM8k)上的准确率提高了 15.0%。这一发现挑战了对预训练损失作为模型评估唯一代理的依赖,并证明了隐性偏差在解锁下游泛化方面的重要性。