论文

词元叠加高效预训练

Efficient Pre-Training with Token Superposition

模型训练预训练

摘要

大语言模型 的 预训练 通常非常昂贵且大规模时效率低下,需要复杂且侵入性的修改才能实现高数据吞吐量。在这项工作中,我们提出了词元叠加训练(TST),这是一种简单的插入方法,可以显着提高 预训练 期间每 FLOP 的数据吞吐量,而无需修改并行性、优化器、词元生成器、数据或模型架构。 TST 分两个阶段完成:(i) 高效的叠加阶段,我们将许多连续的词元合并到一个包中,并使用多热交叉熵 (MCE) 目标进行训练;(ii) 恢复阶段,我们恢复到标准训练。我们在 270M 和 600M 参数的规模上广泛评估 TST,并在 3B 和 10B A1B 专家混合模型上进行验证,证明它在不同设置下具有高度鲁棒性。最终,TST 始终优于基线损失和下游评估,并且在等损失设置下,TST 在 10B A1B 规模下将 预训练 总时间缩短了 2.5 倍。