论文

重复不匹配:为什么数据混合实验无法扩展以及如何修复它们

Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix Them

模型训练预训练

摘要

预训练 数据混合物通常通过运行小规模实验并外推到目标训练预算来调整。当高质量数据稀缺且必须重复时,这种推断经常会失败,但失败的根源尚未被隔离。我们表明,罪魁祸首是重复不匹配:因为高质量数据集很小,它们的重复率会随着训练预算的增长而变化,从而以小规模代理实验无法预料的方式改变最佳混合。与目标重复率相匹配的二次采样过程可控制此效果。在将有限的高质量数据与网络爬行相结合的双源设置中,仅使用 1/16 目标标记的单个重复控制实验在 Wiki-Text 上针对 1.17B 参数模型恢复了 0.10 以内的混合,而没有重复控制的误差为 0.85。在没有重复控制的情况下实现相当的精度需要多个训练水平,当使用两个、三个和四个水平的结果时,分别消耗目标 词元预算 的 19%、44% 和 94%。对于三个数据源,较大的混合空间需要多个实验来约束,但该方法仍然有效:在 757M 规模下,只需两个重复控制的层即可恢复最佳混合,优于需要完整的双源实验来构建的基线。我们的结果表明,决定小规模混合实验是否具有普遍性的是重复动力学,而不仅仅是规模。更广泛地说,他们认为数据重复应该被视为混合优化中的一流变量,而不是有限数据带来的不便的副作用。