论文

Trajectory Soup:通过不同的轨迹推动 LLM 中期训练的计算扩展前沿

Trajectory Soup: Pushing the Compute-Scaling Frontier of LLM Mid-training via Diverse Trajectories

模型优化模型合并

摘要

训练中期为预训练的大语言模型配备了专门的推理能力,但这一阶段的回报是有限的,因为额外的串行计算几乎不会产生进一步的下游改进,甚至可能降低某些能力,这为训练中期吸收的计算量设置了实际上限。我们重新审视如何将此计算分配给单次运行或多个类似的优化。我们发现,在各种受控配方下从共享检查点分叉的分支达到了可测量的不同参数空间区域,并建立了一种扩展一次运行无法提供的兼容多样性形式。因此,我们引入了 Trajectory Soup,它将训练中期预算分配到几个独立的分支上,并通过轨迹内和轨迹间平均将验证时选择的最强检查点合并到单个模型中。局部偏差和方差分析将两个平均水平分开,表明轨迹间平均消除了轨迹内平均范围之外的残余误差,而检查点选择带有偏差,限制了值得合并的检查点数量。在模型规模、学习率计划、词元预算和轨迹计数方面,Trajectory Soup 提高了匹配预算下最强单轨迹平均值的下游聚合性能,并随着预算的扩大而不断改进,在相同的训练后管道后保留了优势。这些结果将轨迹分配和合并定位为将训练中期的计算扩展前沿扩展到串行饱和之外的实用方法。