论文

选择器引导的自主课程,用于从可验证的奖励中进行一次性强化学习

Selector-Guided Autonomous Curriculum for One-Shot Reinforcement Learning from Verifiable Rewards

模型训练合成数据

摘要

最近,可验证奖励的强化学习(RLVR)已被确立为一种高效的技术,用于增强基于单个实例的 大语言模型(LLM)的数学推理技能。当前最先进的 1-shot RLVR 模型采用启发式方法来选择实例,主要基于奖励的历史方差,我们发现这作为可转移性价值的衡量标准本质上具有误导性。在本文中,我们提出了一种选择器引导自主课程(SGAC)方法,该方法在由成功概率、奖励方差、输出分歧(熵)和语义难度级别组成的多维特征空间上采用可学习的选择器模型,而不是静态奖励方差启发式。在我们对候选问题池的实证评估中,我们观察到输出不一致,而不是奖励方差,是后续迭代中推理增益的最强预测因子。利用这一发现,我们开发了一种自主课程算法,用于从大池中动态抽取候选问题,通过学习的选择器对它们进行排名,并运行 1-shot GRPO 的微爆发。我们的框架使用 Hendrycks MATH 基准进行评估,以 Qwen2.5-Math-1.5B 模型作为基线。我们的框架在保留数据集上获得了 68.0\% 的准确率,这优于从最先进的模型获得的准确率 64.0\%,以及 Wang 等人提出的 1-shot RLVR 检查点(其准确率达到了 66.0\%)。结果证实,基于熵的智能数据管理可以比静态训练方法带来严格的推理改进,特别是在严重有限的数据条件下。