论文
Data-DPO:依据目标模型训练反馈选择微调数据
Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training
摘要
有监督微调中的数据选择旨在从大规模候选数据中选择一小组有效样本,在保持模型性能的同时降低训练成本。然而,现有方法通常将数据值视为相对静态的属性,而对数据与目标模型能力分布之间的兼容性关注有限。为了解决这个问题,我们提出了Data-DPO,一种面向目标模型的SFT数据选择方法。 Data-DPO通过一步探测来观察目标模型在不同样本上的局部训练反馈,将样本之间的激活差异转化为成对的数据偏好,并训练轻量级奖励模型来学习目标模型感知的数据偏好。在最终选择阶段,Data-DPO进一步结合目标模型偏好、外部质量得分和边际多样性来构建更加稳定和有效的训练子集。 Vision-Flan 和 LLaVA-CoT 上的实验结果表明,Data-DPO 在多个数据预算下始终优于现有数据选择基线,并稳定超过全数据训练性能。