论文

从实例选择到受监督 微调 的固定池数据配方搜索

From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning

模型训练监督微调与指令调优

摘要

受监督的 微调 (SFT) 数据选择通常被表述为实例排名:对每个示例进行评分并保留 top-$k$ 子集。然而,有效的 SFT 训练子集通常是通过有序的管理配方生成的,其中过滤、混合和重复数据删除运算符共同塑造最终的数据分布。我们将这个问题表述为固定池数据配方搜索:给定一个原始指令池和一个基础运算符库,目标是发现一个可执行配方,在完整 SFT 评估的有限预算下构造高质量的选定子集,而不生成、重写或增强训练样本。我们引入了 AutoSelection,一个两层求解器,它基于缓存的任务、数据和模型端信号将固定池物化与昂贵的全面评估分离,使用预热探针、实现的子集状态、本地配方编辑、高斯过程辅助排序和停滞触发的重新播种。在 90K 指令池上进行的实验表明,AutoSelection 在三个基本模型中实现了最强的分布内推理平均值,优于全数据训练、随机配方搜索、随机 top-$k$ 和单算子选择器。其他分布外图推理结果、搜索稳定性分析、结构消融和 1.5B 到 7B 转移检查进一步表明,配方结构的重要性超出了单个选择算子的范围。代码可在 https://github.com/w253/AutoSelection 获取。