论文
测量与任务无关的训练数据对语言模型预训练的影响
Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining
摘要
在语言模型预训练中一致地衡量训练数据的影响是具有挑战性的。很难选择代表模型一般功能的下游任务或验证集,并且对中间检查点的任务性能的依赖使训练之间的比较变得复杂。我们提出了一种训练数据影响力的衡量方法,不需要选择下游任务或验证集作为归因目标。具体来说,我们通过梯度更新减少到给定预训练运行的最终参数的平方距离的程度来定义示例的影响,并从中间检查点估计这个数量,而无需重新训练。将该方法应用于 Pythia 和 PolyPythia 套件中的 18 种配置,我们发现有影响力的数据存在系统的时间变化。在训练早期,与文献相关的数据与最终参数的轨迹更加一致,而 STEM 数据在后期阶段变得更加一致。这种定性交叉在模型配置之间大致一致。我们的结果提供了一个易于处理的轨迹级视图,显示影响数据在整个预训练过程中如何变化,补充了针对特定下游任务或验证集定义的影响分析。