论文

Extra-Merge:追踪语言模型 预训练 中模型合并的 Rank-1 子空间

Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training

模型优化模型合并

摘要

模型合并已成为增强 大语言模型 (LLM) 的轻量级范例,但其底层机制仍知之甚少。在这项工作中,我们分析了后期 预训练 轨迹并发现了 \textbf{Rank-1 Subspace} 现象:当原始优化步骤剧烈振荡时,连续的 \emph{merged} 检查点崩溃到一个稳定的、近似一维线性流形上。从理论上讲,我们将这一观察结果建立在\emph{河谷}景观分析中:平均充当几何低通滤波器,抑制高曲率噪声以揭示最佳下降方向。利用这一见解,我们提出了 \textbf{Extra-Merge},这是一种 无需训练 策略,它沿着这个子空间进行推断,以最大限度地减少损失,而无需额外的梯度更新。跨 GPT-2 和 LLaMA 系列(124M 到 2B)的大量实验表明,Extra-Merge 始终优于标准合并基线。值得注意的是,它在 Pythia-12B 下游任务上产生了一致的零样本精度增益,并有效地推广到 Muon 优化器 \citep{jordan2024muon}。