论文
Re²:通过带重解的强化学习释放LLM推理能力
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
摘要
带可验证奖励的强化学习(RLVR)通过增加测试时算力,在提升大型语言模型(LLM)推理性能方面展现出前景。然而,即使经过大量RLVR训练,此类模型仍倾向于在思维链(CoT)中生成不必要的低质量步骤,导致低效的过度思考和更低的答案质量。我们表明,当CoT的初始方向或质量欠佳时,模型常常无法到达正确答案,即使其生成的token数是初始CoT良好初始化时的数倍。为此,我们引入Reinforcement Learning with Re-solving(Re²),其中LLM学会在必要时灵活放弃无成效的推理路径并重新开始求解,而不是始终执着于给出最终答案。Re²采用纯强化学习,无需任何初步监督微调,成功将原始模型中仅0.5%的罕见重做行为放大到30%以上。这在相同训练算力预算下带来相对标准RLVR的大幅性能提升,并在样本数增加时展现出显著的测试时性能改进。
