论文

从推理链到可验证的子问题:课程强化学习实现LLM推理的学分分配

From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning

模型训练强化学习

摘要

可验证奖励的强化学习 (RLVR) 在 LLM 推理方面显示出强大的前景,但基于结果的 RLVR 在解决难题时仍然效率低下,因为正确的最终答案很少出现,并且样本级贡献分配无法使用失败尝试中的部分进度。我们引入了 SCRL(子问题课程强化学习),这是一种课程强化学习框架,它从参考推理链中导出可验证的子问题,并将最终的子问题修复为原始问题。这将困难问题的部分进展转化为可验证的学习信号。在算法上,SCRL 使用子问题级标准化,在每个子问题位置独立标准化奖励,并将所得优势分配给相应的答案范围,从而无需外部评分标准或奖励模型即可实现更细粒度的贡献分配。我们的分析表明,子问题课程将难题从梯度死区中提升出来,随着原始问题变得更难,相对收益更大。在七个数学推理基准测试中,SCRL 的表现优于强大的课程学习基线,在 Qwen3-4B-Base 上比 GRPO 平均准确度提高了 4.1 分,在 Qwen3-14B-Base 上提高了 1.9 分。在 AIME24、AIME25 和 IMO-Bench 上,SCRL 在 Qwen3-4B-Base 上进一步将 pass@1 提高了 +3.7 分,将 pass@64 提高了 +4.6 分,这表明对硬推理问题有更好的探索。