论文

LLM如何消费高质量数据?通过质量意识功能缩放法则实现最佳数据调度

How Should LLMs Consume High-Quality Data? Optimal Data Scheduling via Quality-Aware Functional Scaling Laws

模型训练预训练

摘要

大语言模型(LLM)训练中高质量数据稀缺,但如何安排其与优化动态的使用缺乏理论指导。我们用时变数据质量扩展函数缩放定律,并在特征空间回归模型中推导出渐近最优联合数据质量和批量大小计划。该解决方案揭示了高质量数据的两种机制和双重用途:在噪声有限的机制中,较小的批次可以在可比较的噪声下将更干净的数据转换为更多的信号;在信号受限的情况下,后期放置可以抑制终端噪声而不牺牲信号积累。这解释了为什么传统的衰减时间表可能与课程式管道发生冲突。受理论结构的启发,我们为 LLM 训练中期提出了 Drop-Stable-Rampup:在质量转换时降低批量大小,保持较低以积累信号,然后增加以抑制噪声。在对通用域专有数据的 108B 词元进行中间训练的 15B MoE 模型上,Drop-Stable-Rampup 比 Warmup-Stable-Decay 提高了 +1.70,将 Cosine-decay 提高了 +2.98,包括 GSM8K 上的 +4.23 和 MATH 上的 +2.80。在公共数学和代码混合中,它领先于所有报告的 STEM、数学和代码基准,在 600M 密集模型上将整体平均值比最强基线提高了 +3.27,在相同的 MoE 架构上将整体平均值提高了 +5.25。