论文

SFT-then-RL 在 LLM 推理方面优于混合策略方法

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

模型训练强化学习

摘要

最近用于 LLM 推理的混合策略优化方法,交错或混合监督和强化学习信号,报告了对标准 SFT-then-RL 管道的改进。我们发现,最近发表的许多研究论文都依赖于由两个不同错误引起的错误基线:DeepSpeed 中的 CPU 卸载优化器错误,在梯度累积期间默默地丢弃中间微批次(影响多个下游框架,包括 TRL、OpenRLHF 和 Llama-Factory),以及 OpenRLHF 中的损失聚合错误,错误地对每个小批次损失进行加权。它们一起抑制了 SFT 性能,优化器错误占了大部分差距,损失聚合错误贡献了较小的额外影响。经过纠正后,标准 SFT-then-RL 管道超越了我们评估的所有已发布的混合策略方法,在 Qwen2.5-Math-7B 的数学基准上提高了 3.8 分,在 Llama-3.1-8B 的数学基准上提高了 22.2 分。即使只有 50 个 RL 步骤的截断变体在数学基准上也优于混合策略方法,同时使用更少的 FLOP。