论文
混合训练:将小规模支架式预训练重新组合成更大的语言模型
Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model
摘要
我们询问语言模型 预训练 是否可以分解为更小的、可独立训练的作业,然后可以将其重新组合成一个连贯的更大模型。我们引入了混合训练(MoT),这是一种支架式模块化 预训练 程序,它将目标 Transformer 划分为连续的层块,在冻结的预训练对准器支架内训练每个块,然后使用可选的短端到端适应通道重新组合训练后的块。在 C4 上训练的 1.3B 参数 Gemma 式模型上,MoT 提供了小规模的机制证明:独立训练的深度切片可以重组为可用的语言模型,并且质量平价计划达到与整体基线相同的报告困惑度。这种奇偶校验设置处理更多的聚合词元,并且在对准器准备后具有更短的理想化层等效关键路径;其有效的计算优势取决于跨运行重复使用对齐器。因此,我们提出 MoT 并不是作为整体 预训练 的一般替代品,而是作为一个小规模框架,用于研究脚手架子运行是否可以充当可重用的训练单元。