论文

LLM预训练中领域数据重复的规模化研究

Scaling Domain Data Repetition in LLM Pretraining

模型训练预训练

摘要

随着大语言模型规模扩大,训练token预算也必须增长,以维持合适的每参数token数(TPP)。然而,高质量领域数据远比通用网络数据难以扩展。随着模型规模和训练token预算的增长,领域数据在训练混合中的占比趋于下降。重复可用的此类高质量数据是抵消这种稀释的有效方法,但过度重复可能导致过拟合。我们在实际的LLM扩展设定下研究这一权衡,其中训练token预算与模型规模成比例增长。对于固定领域,我们首先发现,令人惊讶的是,在固定TPP下,最优重复次数随模型规模温和增加。跨领域来看,我们发现最优重复次数与领域的最终验证损失呈强负相关:验证损失更低的领域通常能从更多重复中获益。相比之下,领域唯一数据量与最优重复次数只有弱相关。这些发现表明,在相同TPP下用较小的代理模型调优的重复次数,可以为更大模型提供实用估计。