论文

BLADE:用于 LLM 训练的可扩展双层自适应数据选择

BLADE: Scalable Bi-level Adaptive Data Selection for LLM Training

模型训练合成数据

摘要

随着 大语言模型 (LLM) 数据集扩展到数万亿个词元,数据选择已成为过滤无信息噪声和构建自适应学习轨迹的关键前沿。除了静态启发式过滤之外,LLM 训练的高级数据选择方法主要遵循两种范式,每种范式都有基本限制。基于影响的方法提供了有原则的双层目标,但需要棘手的逆 Hessian 计算,而过度损失方法的计算效率很高,但依赖于静态参考模型,该模型在训练过程中与不断发展的代理模型不一致。我们提出了 BLADE(双层自适应数据选择),一种无 Hessian 的数据选择框架。 BLADE 通过拉格朗日乘子将基于影响的方法背后的双层优化问题重新表述为惩罚单层目标,避免了逆 Hessian 计算,同时揭示了与基于过度损失的数据选择的原则联系。由此产生的目标恢复了过度损失的形式,但用与训练保持同步的动态参考模型取代了静态参考模型。从理论上讲,我们证明了这种惩罚公式保证了一阶收敛。为了高效的在线批次选择,我们将 BLADE 实例化为无记忆随机块坐标 Frank-Wolfe 算法。大量实验表明,BLADE 始终优于最先进的数据选择基线,为 LLM 训练提供了实用的方法。