论文
数据达尔文主义第二部:DataEvolve——AI 可以自主演化预训练数据整理
Data Darwinism Part II: DataEvolve -- AI can Autonomously Evolve Pretraining Data Curation
摘要
数据达尔文主义(第一部分)确立了数据处理的十级层级,表明更强的处理能够释放更大的数据价值。然而,该工作依赖针对单一类别手工设计的策略。现代预训练语料库包含跨越领域与内容类型的数百个异构类别,每一类都需要专门处理。在这样的规模下,手工设计策略变得不切实际。这引出一个关键问题:策略能否以自动化方式演化?我们提出 DataEvolve,一个让策略通过迭代优化而非手工设计来演化的框架。对每个数据类别,DataEvolve 在一个封闭的演化循环中运行:识别质量问题、生成候选策略、在抽样数据上执行、评估结果,并跨代际改进方法。该过程通过已发现问题构成的经验池和跟踪各轮迭代表现的策略池来积累知识。应用于 Nemotron-CC 中跨 672B 词元的 8 个类别后,DataEvolve 产出 Darwin-CC——一个 504B 词元的数据集,其策略经过每类别 30 轮迭代演化。在 500B 词元上训练 3B 模型时,Darwin-CC 优于原始数据(+3.96 分),在 18 个基准上取得 44.13 的平均分,超过 DCLM、Ultra-FineWeb 和 FineWeb-Edu,并在 MMLU 等知识密集型任务上有显著提升。分析显示,演化出的策略收敛于以清洗为核心的方法:有针对性的噪声去除与格式规范化并进行领域感知的保留,呼应第一部分的 L4(生成式精炼)原则。消融研究证实迭代演化必不可少:优化后的策略比次优策略高出 2.93 分,确立了演化式策略设计对预训练规模数据整理既可行又必要。
