论文
RPO:部分推理优化的强化微调
RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization
摘要
在大语言模型领域,强化微调算法需要从输入查询开始生成完整的推理轨迹,这在训练的rollout阶段带来显著计算开销。为解决这一问题,我们分析推理路径不同片段对最终结果正确性的影响,并基于这些洞见提出部分推理优化的强化微调(RPO),一种即插即用的强化微调算法。与生成完整推理路径的传统强化微调算法不同,RPO通过经验缓存生成推理路径的后缀来训练模型。在训练的rollout阶段,RPO将该阶段的token生成减少约95%,大幅降低理论时间开销。与全路径强化微调算法相比,RPO将1.5B模型的训练时间减少90%,7B模型减少72%。同时,它可与GRPO和DAPO等典型算法集成,使其在保持与原算法相当性能的同时实现训练加速。代码开源于 https://github.com/yhz5613813/RPO。
