论文

如何合成高质量的预训练数据?即时设计、生成器模型和源数据的系统研究

How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data

模型训练合成数据

摘要

合成数据是训练 大语言模型 的标准组成部分,但跨设计维度的系统比较(包括改写策略、生成器模型和源数据)仍然缺乏。我们进行了广泛的受控实验,生成了超过一万亿个词元,以确定将网络文本重新表述为合成预训练数据的关键因素。我们的结果表明,结构化输出格式(例如表格、数学问题、常见问题解答和教程)始终优于策划的网络基线和先前的合成方法。值得注意的是,将生成模型的大小增加到超过 1B 参数不会带来额外的好处。我们的分析还表明,用于混合的原始数据的选择会极大地影响性能。通过应用我们的发现,我们开发了 \textbf{\textsc{FinePhrase}},这是一个包含 4860 亿词元的改写网络文本的开放数据集。我们证明 \textsc{FinePhrase} 优于所有现有的合成数据基线,同时将生成成本降低多达 30 倍。我们向研究社区提供数据集、所有提示和生成框架。