论文

RASFT:用于推理的执行轨迹自适应监督 微调

RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

模型训练监督微调与指令调优

摘要

有监督的 微调 (SFT) 是一种通过模仿离线专家演示来使 大语言模型 适应推理任务的流行方法,通常将单个专家轨迹视为目标行为。然而,推理并不是简单的路径模仿:严格遵循一种演示的解决方案可能会过度拟合表面形式并抑制模型自身的推理分布。我们提出了 Rollout-Adaptive Supervised 微调 (RASFT),这是一种策略感知的 SFT 框架,可根据经过验证的 同策略 rollout 估计的问题级可解决性来校准专家监督。对于每个问题,RASFT 在当前政策陷入困境时加强专家指导,同时在模型已经表现出可靠的推理行为时放松僵化模仿并纳入正确的自生成轨迹。为了保留有用的推理先验,RASFT 进一步在冻结的参考模型和当前策略之间引入了一个截断的反比,以限制过度的策略漂移。在六个数学推理基准和两个代码推理基准上跨多个模型进行的实验表明,RASFT 比 SFT、SFT 变体和代表性 RL 方法实现了更好的整体性能。代码可在 https://github.com/zjd1sq/RASFT 获取。