论文

SYNTH:以全合成数据支持单阶段大语言模型训练

It's All Training: A Fully Synthetic Single-Stage Recipe for LLMs

模型训练合成数据

摘要

当前的预训练数据集源自网络爬虫,存在所有问题,并且并非旨在支持训练中和训练后管道——例如,它们几乎不包含明确的推理。因此,许多前沿实验室已经开始从最先进的模型开始开发自己的内部数据集,以增强其预训练数据组合,例如通过推理轨迹来解决冷启动问题。虽然这些数据集被证明是有效的,但没有一个是公开的,而且这种所谓的合成数据对语言模型(包括小型模型)的知识和技能获取的影响仍然知之甚少。我们推出了 SYNTH,这是第一个源自 58,698 篇维基百科文章的开源合成语料库,它通过对精选的百科全书种子进行结构化放大,将训练前、训练中和训练后压缩为单个训练阶段。我们通过训练一套模型来评估 SYNTH:56M 微型模型 (Monad)、0.3B-0.6B 密集模型 (Baguettotron) 和 13B / 1B 主动 MoE。在 iso-compute 中,SYNTH 的性能优于过滤后的网络数据,并且我们的模型与类似大小的开放权重基线相比仍然具有竞争力。由于 SYNTH 是从基础段落反向翻译的,因此尽管训练标记减少了 10-140 倍,但 SYNTH 训练的模型仍能实现较高的事实精度,并且以种子语料库为目标进行记忆。这些结果表明,包括我们的 SYNTH 数据集在内的合成数据集能够从训练数据的一小部分生成有竞争力的通用模型,从而随着前沿的进步实现快速迭代。这些发现为数据效率显着提高的通才模型以及没有可用指令或会话数据的特定领域模型开辟了可能性。最后,我们在许可下公开发布 SYNTH 数据集和 Baguettotron 模型套件,从而支持开源语言模型开发。