论文

后训练 的凸数据集估值

Convex Dataset Valuation for Post-Training

模型训练合成数据

摘要

提高 LLM 在下游任务上的性能有时需要在 后训练 期间利用辅助数据集。然而,在实践中,开发人员面临计算、标签和许可成本的限制,无法使用所有可用数据,因此需要有原则的数据集级别选择。这些限制越来越多地受到数据集市场的影响,其中数据获取受到预算和谈判的控制。我们将数据集评估作为 LLM 后训练 期间的子集选择问题进行研究。我们的目标是识别辅助数据集并对其进行加权,以便在预算有限的情况下最大化目标任务性能。我们首先表明,常用的梯度对齐分数提供了合理但不完整的评估信号,因为它们忽略了数据集之间的冗余。为了解决这个问题,我们提出了一种基于梯度空间中的核均值匹配(KMM)的可扩展凸数据集级评估方法,该方法共同考虑了与目标任务的对齐以及辅助数据集之间的冗余。通过在不同的 后训练 设置和任务中进行广泛的实验,我们表明我们的方法始终优于现有的评估基准,以较低的计算开销实现了更强的性能。我们的结果将数据集评估定位为市场受限的 大语言模型 设置中 后训练 数据选择的实用决策工具。该代码可在 https://github.com/uiuctml/convex_data_valuation 获取。