论文
重新思考 LLM 训练中的数据管理:在线重新加权比离线方法提供更好的泛化能力
Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods
摘要
数据管理是 大语言模型 (LLM) 训练中一个关键但尚未充分探索的领域。现有的方法,例如数据选择和混合,以离线模式运行,脱离了训练。这种分离引入了工程开销,并使管理变得脆弱:整个管道必须在模型/任务转换下重新运行。此外,离线方法通过硬过滤或重采样来改变数据大小,通常会牺牲数据多样性并损害泛化能力。我们建议将数据管理重新考虑为在线重新加权问题,其中样本重要性在训练期间通过损失加权而不是静态预处理来动态调整。具体来说,我们引入了 ADAPT(用于预训练和微调的自适应数据重新加权),这是一种动态在线框架,可通过基于相似性的质量信号引导的自适应每样本学习率来重新加权训练样本,而无需更改训练样本的数量。与强制静态数据分布的离线方法不同,ADAPT 充当隐式课程学习者,随着模型的发展逐渐将焦点从粗粒度模式转移到细粒度语义区别。指令调优和大规模预训练的实验表明,ADAPT 始终优于离线选择/混合和先前的在线方法,在相同的 FLOP 下实现了更强的跨基准泛化。