论文

q0:超纪元预训练的原语

q0: Primitives for Hyper-Epoch Pretraining

模型训练预训练

摘要

由于计算的增长速度超过了高质量文本的供应速度,多时代训练正在成为标准。但是,在计算预算耗尽之前,预训练单个模型在几次传递内就会饱和。我们认为,这需要概念上的转变,从训练单个模型转向探索模型群体并汇总它们的预测。我们引入了超纪元预训练(q0),它将多纪元预算转变为多种模型的群体,其组合预测达到比单个精炼模型更低的验证损失。 q0 减少到三个核心原语。具有反相关学习率和权重衰减的循环调度从几个并行轨迹中收集不同的模型。 Chain 蒸馏 针对其前身训练每个模型,以便模型质量在整个人群中得到复合。学习先验,适合保留的集合,为任何推理预算选择成员并对其进行加权。在使用 100M FineWeb 词元训练的 1.8B 参数模型上,q0 匹配强大的 256 纪元集成基线,仅使用约 56 纪元(减少约 4.6 倍),或在与基线的集成大小匹配时使用约 67 纪元(减少约 3.8 倍),并继续改进。在 Slowrun 设置下,这些收益累计达到约 12.9 倍的数据效率,并转移到下游基准。至关重要的是,最优分配会随着预算的变化而变化,因此我们给出了如何使用给定时期预算以最大化泛化的规定方案,从单个时期到最大预算。