论文
从检查点变化到监督微调中的选择增益
From Checkpoint Variation to Selection Gains in Supervised Fine-Tuning
摘要
检查点选择是监督微调(SFT)中的常规决策:训练产生多个检查点,但只保留一个。然而,固定预算比较本身并不能区分三个经验主张:更多的验证数据是否可以改善检查点选择,选择规则是否优于验证损失选择,以及它是否比简单地保留最终检查点有所改进。因此,我们将检查点选择视为有限信息决策问题。保持已完成的训练轨迹、候选检查点和固定的独立测试项目,我们改变验证预算并单独衡量附加验证数据的改进、负对数似然(NLL)选择的增益以及最终检查点的增益。在 60 个数学 SFT 轨迹和 19 种配置中,将验证预算从 32 个示例增加到 305-313 个示例,生成精度选择的独立测试精度提高了 0.32 个百分点 (pp),检查点一致性提高了 0.29 个百分点,95% 配置引导 CI 分别为 [0.10, 0.56] 和 [0.11, 0.50]。在完整的验证预算下,两个基于生成的规则分别比匹配的 NLL 选择高出 0.71 和 0.85 个百分点,而它们相对于最终检查点的增益仍未解决。对 12 个新训练的常识轨迹进行的跨域复制显示出相同的定性分离:将验证预算从 32 个问题增加到 1,024 个问题将生成准确性和检查点协议选择提高了 0.87 个和 0.27 个 pp,而最终检查点的收益仍然悬而未决。总之,这些结果表明,受益于更多验证数据、优于 NLL 选择以及优于最终检查点是需要单独证据的不同经验主张。