论文

用于合成数据选择的训练感知目标覆盖范围

Training-Aware Target Coverage for Synthetic Data Selection

模型训练合成数据

摘要

合成数据越来越多地用于扩展大语言模型训练,但更多的合成数据并不一定会产生更好的模型。有用的合成数据必须添加与目标任务相关的信息,而不会引入抵消其优势的错误,并且示例的价值可能会随着训练集的增长而变化。我们开发了一种线性理论来描述这种权衡,并确定合成数据在哪里有用、应该添加多少,以及向现有数据集中添加一个示例的边际价值。该分析显示了仅输入覆盖范围就足够以及还必须考虑合成误差的条件。在这些结果的指导下,我们引入了 Training-Aware Target Coverage (TATC),一种用于 LLM 微调的合成数据选择方法。 TATC 识别训练效果有利于目标任务的候选者,并在其中进行选择,以扩大可用数据尚未代表的目标相关方向的覆盖范围。文本和图像数据的实验验证了线性理论。在数学推理任务中,TATC 选择综合解决方案来微调 Qwen2.5-Math-1.5B-Instruct,并在选择预算范围内优于 GSM8K 上的替代合成数据选择方法。总之,我们通过量化和最大化其对目标任务的价值,提供了一种原则性的合成数据选择方法。