论文
课程强化学习可以激励 LLM 超越基本模型的推理能力
Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model
摘要
具有可验证奖励的强化学习(RLVR)被广泛认为是持续改进 大语言模型 的一条有前途的道路。然而,最近的研究表明,主流的RLVR经常在基础模型中已经存在的轨迹之间重新分配采样概率:它可以提高采样效率,体现在更高的pass@1分数上,但收益有限,甚至在k很大时会降低pass@k分数,因此可能无法扩展基础模型的推理能力边界。在本文中,我们提出了一种边界感知课程强化学习方法,以超越基本模型的推理能力边界。我们的方法首先使用 pass@k 采样来定位当前的推理能力边界,然后对接近或超出该边界的示例进行有针对性的教师指导,最后使用 RL 来巩固新引入的推理模式。在 Qwen、Llama 和 DeepSeek 基础模型中,边界感知课程 RL 提高了 pass@1 分数和 pass@256 分数,其中 pass@1 反映单次尝试性能,pass@256 充当推理能力边界的经验代理。在我们的实验中,平均 pass@256 比基本模型提高了 9.8 个百分点,比 Vanilla RLVR 提高了 10.3 个百分点。这些结果表明,边界感知课程强化学习可以为 LLM 提供可扩展的途径,以不断改进基本模型的经验推理能力边界。