论文
解锁无法解决的问题:教师指导的数据高效 RLVR 课程
Unlocking the Unsolvable: Teacher-Guided Curriculum for Data-Efficient RLVR
摘要
具有可验证奖励的强化学习(RLVR)在改进大型语言模型的数学推理方面取得了显着的成功。然而,超出模型当前能力的问题(即采样轨迹一致失败并且不产生学习信号)在结构上是浪费的,尽管标记了信息最丰富的训练前沿。我们表明,这些惰性问题可以通过教师指导的课程学习来解决:来自更强模型的部分推理痕迹创建了分级难度景观,而后向链接课程逐渐撤回指导,直到模型独立解决问题。仅对 128 个无法解决的问题进行训练,就两个基本模型的九个基准平均值而言,与在完整的 2,000 个问题语料库上训练的 GRPO 相匹配或超过(约 16 倍的数据效率),同时大幅扩展了 pass@k 在大 k 处测量的推理边界。此外,我们确定了在仅无法解决的情况下特别严重的分配转移成本,并提出了单调前沿课程(MFC),这是一种单调驱动训练走向无指导解决的方法,始终优于现有课程方法。