论文
面向高效推理的同策略监督微调
On-Policy Supervised Fine-Tuning for Efficient Reasoning
摘要
大型推理模型(LRM)通常用强化学习(RL)训练以探索长思维链推理,在高计算成本下取得强劲性能。近期方法加入多重奖励目标来联合优化正确性与简洁性,但这些复杂扩展常使训练不稳定并产生欠佳的权衡。我们重新审视该目标,并质疑这种复杂性的必要性。通过有原则的分析,我们找出该范式中的根本错位:当正确性与长度可直接验证时,KL 正则化失去其预期作用;在多重奖励信号下,分组归一化变得含糊。在移除这两项并把奖励简化为基于截断的长度惩罚后,我们证明该优化问题归结为对自生成数据做监督微调,数据按正确性与简洁性双重过滤。我们将这一简化训练策略称为 on-policy SFT。尽管简单,on-policy SFT 始终界定着准确率-效率的 Pareto 前沿。它在保持原始准确率的同时将 CoT 长度最多减少 80,在五个基准上超过更复杂的基于 RL 的方法。此外,它显著提升训练效率,将 GPU 显存占用减少 50%,并使收敛加速 70%。代码见 https://github.com/EIT-NLP/On-Policy-SFT。
