论文

内部数据重复破坏了语言模型

Internal Data Repetition Destroys Language Models

模型训练预训练

摘要

语言模型已经耗尽了高质量的训练数据,甚至积极去重复的语料库也保留了一定数量的重复。早期的对照研究早于龙猫式的缩放定律,只能间接测量重复的成本。我们重新审视 Chinchilla 时代的重复,使用拟合的无重复缩放定律来报告计算等效增益和计算等效损失。我们表明,在这种现代化范式下,重复损害在三个方面是系统性的。首先,保持分配给重复数据的计算不变,评估损失在中间重复计数 $\Rep$ 处达到峰值;重复适度大小的子集适度的次数比重复几次大的子集或多次重复小子集对性能的损害更大。其次,该峰值的位置与模型大小的幂律非常吻合;这一缩放定律表明,最具破坏性的重复数据数量的增长速度比计算速度更快。最后,当重复文档在受控精确文档重复设置中消耗 FLOP 预算的 10% 时,计算等效损失可能会很大:在 FineWeb-Edu-Dedup 上,Qwen3 型 344M 参数模型在 $\OT=1$ 时最具破坏性的重复计数与使用 67% FLOP 的无重复运行的损失相匹配。我们证明这些现象不是特定于语言模型的,并且可以在简单的统计模型中进行分析理解:带有逐字重复的错误指定的线性回归再现了相同的定性损失峰值,量化了这些峰值如何从记忆和泛化之间的统计权衡中产生。我们的研究结果提高了语言模型重复研究的精度,使实践者能够量化预训练语料库中重复项的存在和重复结构所造成的计算浪费。