论文
从有机数据生成预训练词元以进行数据绑定扩展
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
摘要
LLM 预训练正在从计算绑定转向数据绑定,其中可用的人类(有机)文本远远不能满足扩展需求。然而,达到数据绑定状态并不意味着该模型已充分利用其有机语料库。在本文中,我们介绍了 SynPro,这是一个合成数据生成框架,可以帮助 LLM 更彻底地从有限的有机数据中学习。 SynPro应用两种操作,即重新措辞和重新格式化,以不同的形式呈现相同的有机源,以促进更深入的学习,而无需引入外部信息。两个生成器都通过强化学习进行了质量、忠实性 和数据影响奖励的优化,并随着预训练平台不断更新,以目标模型尚未吸收的内容。我们使用 DCLM-Baseline 中 10% 的 Chinchilla 最佳标记(0.8B、2.2B 和 4B)对 400M、1.1B 和 2B 模型进行预训练,反映了前沿预训练中真实的数据绑定机制。我们的结果表明,标准重复对有机数据的利用明显不足:SynPro 解锁了 3.4--5.2 倍的重复有效标记,甚至超过了在 1.1B 和 2B 规模上训练等效唯一数据的非数据绑定预言机。分析证实,忠实的模型感知综合可以维持数据绑定扩展,而不会导致分布崩溃。我们在 https://github.com/cxcscmu/SynPro 开源我们的代码。