论文
通过训练动态进行综合数据表征
Synthetic Data Characterization via Training Dynamics
摘要
解释大语言模型生成的数据的属性对于理解其在学习任务中的效用和局限性非常重要。在这项工作中,我们通过样本级别的可学习性来表征合成数据,研究大语言模型系列和量表之间的差异,并以人类编写的数据作为参考。我们首先生成涵盖单标签和多标签分类、标签和树预测任务的合成数据集。然后,我们从机器数据和有机数据的编码器训练动态中得出经验数据分布,并估计这些分布在编码器之间的鲁棒性。最后,我们评估基于这些可学习性信号的数据选择策略如何对两个数据源产生不同的影响。