论文

Spokes:优化多样化的预训练数据选择

Spokes: Optimizing for Diverse Pretraining Data Selection

模型训练合成数据

摘要

多样性在数据选择中发挥着关键作用,通过减少冗余和重复来提高固定数据预算下的性能。然而,优化多样性本质上是具有挑战性的,因为它是一个集合级属性,取决于数据点之间的交互而不是单个示例。因此,现有方法通常依赖于代理或近似,这通常无法确保子集足够多样化。在这项工作中,我们通过引入基于 G-Vendi 分数的概率多样化框架来直接优化多样性,并通过指数梯度下降进行优化。我们的方法产生的子集比通过随机采样获得的子集更加多样化,在 50 万样本子集上实现了 +489 的 G-Vendi 分数增加。我们在 FineWeb 和 DCLM 上评估我们的方法,它始终优于现有方法。值得注意的是,SPOKES(仅多样性)比 DCLM 和 FineWeb 上的随机采样分别将平均下游性能提高了 +0.4 和 +0.5 个点。更重要的是,针对质量和多样性的联合优化产生了最强的结果:SPOKES 在 DCLM 和 FineWeb 上实现了 +1.5 和 +1.4 分,优于所有基线,包括语义重复数据删除和质量过滤。