论文

有效的合成数据管理需要群体级别的信号

Effective Synthetic Data Curation Requires Group-Level Signals

模型训练合成数据

摘要

现在,合成数据对于大语言模型训练至关重要,用于增强自主和长期任务执行等高级能力。然而最近的研究表明,大规模训练可能会降低模型的生成速度,因此决定哪些合成数据值得训练非常重要。虽然当前的数据管理实践是使用个体级别的信号(即,单独估计每个数据样本的训练效用)来实现这一点,但在训练前和后训练设置中,我们表明这对于合成数据来说是不够的,并且组级别的信号(即,考虑数据样本之间交互的效用估计)对于有效的数据管理是必要的。首先,我们表明个体层面的信号对样本如何共同影响训练是盲目的:具有不同组成的合成数据集在个体层面的影响下可能无法区分,但在群体层面的影响下差异很大,而后者的策划会产生更好的下游性能,特别是在生成能力方面。其次,我们发现,随着训练管道变得越来越综合,组级信号变得更加重要:在广泛使用的数据管理方法中,只有那些包含它们的方法比基线有所改善,当捕获样本之间关系的权重被放大时,增益会增加。最后,我们将这些发现转化为实践——对于计算预算有限的模型开发人员,我们提供了一种廉价的诊断方法,可以优先考虑哪些合成数据组最需要组级估计,从而以一小部分计算成本恢复完整组级评分的大部分好处。