论文

步骤拒绝 微调:实用的 蒸馏 食谱

Step Rejection Fine-Tuning: A Practical Distillation Recipe

模型训练监督微调与指令调优

摘要

拒绝 微调 (RFT) 是训练 LLM 智能体的标准方法,其中不成功的轨迹将从训练集中丢弃。在 SWE 基准任务的上下文中,这对应于过滤掉提交的补丁未通过测试的运行。然而,这种方法丢弃了未解决的轨迹,尽管它们构成了困难任务的所有轨迹的很大一部分,而且即使这样也可能是部分正确的。在这项工作中,我们提出了 Step Rejection 微调 (SRFT) - 一种利用这些未解决的轨迹的实用方法。为此,我们聘请了评论家 LLM 来评估轨迹中每一步的正确性。因此,在训练过程中,我们掩盖了错误步骤的损失,同时将它们保留在上下文窗口中。通过这种方式,我们可以确保模型学会从错误中恢复,而不会重现错误。 SWE-bench Verified 评估表明,RFT 通过排除未解析的轨迹将分辨率提高了 2.4%,而 SRFT 通过过滤而不是完全丢弃,分辨率提高了 3.7%,总分辨率达到 32.2%。