论文

TailSFT:过滤后的 微调 提高了 后训练 性能

TailSFT: Filtered Fine-Tuning Improves Post-Training Performance

模型训练监督微调与指令调优

摘要

强化学习 后训练 推动了现代人工智能系统的推理和代理能力,但越来越多的工作表明,当用于微调已有能力的基础模型时,它是最有效的。我们质疑现有的流程是否能产生最适合强化学习的模型。基于之前强调覆盖率和 pass@K 作为 RL 后性能预测因子的作用的工作,我们设计了对监督 微调、TailSFT 的简单修改,它在训练期间过滤掉已经拟合的序列,从而将学习重点放在数据分布的欠建模区域或尾部。我们通过受控实验和理论分析的结合来证明和验证 TailSFT 中的设计选择,特别是特定的过滤标准。在 OLMo-3 7B 上,TailSFT 通常可以提高数学和编码评估的 pass@16 性能,绝对增益高达 17%,同时产生最小的计算开销。这些较高覆盖率的检查点在随后的 GRPO 运行中一致转化为高达 4% 的绝对 pass@1 增益,这表明 TailSFT 检查点可以为 RL 提供更好的初始化。我们进一步引入了一种轻量级诊断,用于识别 TailSFT 最有可能提供帮助的设置。更广泛地说,我们的结果激发了一种有原则的、阶段感知的模型开发方法,其中中间检查点是根据它们支持后续训练的有效性来判断的。