论文

PPL-Factory:从语言建模到推理的任务感知和预算感知数据选择

PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

模型训练合成数据

摘要

并非所有训练样本对 大语言模型 微调 的贡献均等。选择信息丰富的训练样本可以降低计算成本,同时保持下游性能。许多现有的数据选择方法依赖于间接启发法,例如数据质量、多样性或推理轨迹长度。然而,这些固定标准的有效性取决于任务,并且很难在不同的下游任务中推广。基于困惑度的数据选择提供了一种简单且模型感知的解决方案来估计样本难度,但现有方法通常对整个训练序列进行评分,并忽略语言建模和推理任务的学习目标的差异。在本文中,我们提出了 PPL-Factory,这是一个简单且可解释的数据选择框架,它结合了任务感知的基于困惑的分数和数据预算感知的选择标准。 GSM8K 上的实验表明,仅使用 $1\%$ 的训练集,PPL-Factory 就优于其他最先进的数据选择方法。使用 $10\%$ 的数据,PPL-Factory 在 GSM8K 上比全数据 微调 准确度高出 0.9,在 MATH 上高出 4.8。总的来说,我们的结果表明,任务感知和预算感知的基于困惑的选择为高效的 微调 提供了一种有效且适用的方法。