论文
数据达尔文主义第一部分:释放科学数据用于预训练的价值
Data Darwinism Part I: Unlocking the Value of Scientific Data for Pre-training
摘要
数据质量决定基础模型性能,但系统性的处理框架仍然缺乏。我们提出Data Darwinism,一个将数据-模型协同演化概念化的十级分类体系(L0-L9):先进模型为下一代系统产出更优数据。我们在科学文献上对此进行验证,构建了Darwin-Science,一个900B token的语料库(L0-L5)。我们识别出原始科学文本中的可学习性差距,并通过L4(生成式精炼)与L5(认知补全)、利用前沿LLM来显式化推理与术语,从而弥合该差距。为确保严格的归因,我们从零预训练了daVinci-origin-3B/7B模型,排除科学内容以构建无污染基线。经过600B token的继续预训练,Darwin-Science在20多个基准上比基线高出+2.12(3B)与+2.95(7B)分,在对齐领域的任务上提升至+5.60与+8.40分。系统性推进至L5带来+1.36的总增益,证实更高层级的处理能够释放数据的潜在价值。我们发布Darwin-Science语料库与daVinci-origin模型,以支持有原则的协同演化式开发。
