论文

Re²:通过带重解的强化学习释放LLM推理能力

$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving

模型训练强化学习RLVR

摘要

带可验证奖励的强化学习(RLVR)通过增加测试时算力,在提升大型语言模型(LLM)推理性能方面展现出前景。然而,即使经过大量RLVR训练,此类模型仍倾向于在思维链(CoT)中生成不必要的低质量步骤,导致低效的过度思考和更低的答案质量。我们表明,当CoT的初始方向或质量欠佳时,模型常常无法到达正确答案,即使其生成的token数是初始CoT良好初始化时的数倍。为此,我们引入Reinforcement Learning with Re-solving(Re²),其中LLM学会在必要时灵活放弃无成效的推理路径并重新开始求解,而不是始终执着于给出最终答案。Re²采用纯强化学习,无需任何初步监督微调,成功将原始模型中仅0.5%的罕见重做行为放大到30%以上。这在相同训练算力预算下带来相对标准RLVR的大幅性能提升,并在样本数增加时展现出显著的测试时性能改进。

Re²:通过带重解的强化学习释放LLM推理能力
图5:Re 2 的框架。对于每个查询,Re 2 采样多个前缀,然后为每个前缀生成多个续写。优势在每个组内计算,而组外准确率被用作redo动作的奖励。