论文

RPO:部分推理优化的强化微调

RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization

模型训练强化学习RLVR

摘要

在大语言模型领域,强化微调算法需要从输入查询开始生成完整的推理轨迹,这在训练的rollout阶段带来显著计算开销。为解决这一问题,我们分析推理路径不同片段对最终结果正确性的影响,并基于这些洞见提出部分推理优化的强化微调(RPO),一种即插即用的强化微调算法。与生成完整推理路径的传统强化微调算法不同,RPO通过经验缓存生成推理路径的后缀来训练模型。在训练的rollout阶段,RPO将该阶段的token生成减少约95%,大幅降低理论时间开销。与全路径强化微调算法相比,RPO将1.5B模型的训练时间减少90%,7B模型减少72%。同时,它可与GRPO和DAPO等典型算法集成,使其在保持与原算法相当性能的同时实现训练加速。代码开源于 https://github.com/yhz5613813/RPO。

RPO:部分推理优化的强化微调
图 2:RPO 框架概述。整个训练过程描述如下: 模型使用缓存的答案片段生成新的答案;根据奖励系统选择最佳响应或随机响应进行优化;并且缓存不断更新,提高训练效率和稳定性。