论文
问题引问题:竞赛数学强化自我进化课程微调
Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics
摘要
向语言模型传授尚未掌握的技能会受到三个反复出现的困难的阻碍:训练数据稀缺,真值 推理轨迹通常不可用,模型通常表现出明显的上限,超过该上限,额外的数据不会产生进一步的改进。我们在受控环境 微调 Qwen2.5-Math-7B 竞赛数学 (AIME) 中研究这些困难,该任务最初仅解决了 5.6% 的问题 (pass@1)。为了解决数据稀缺问题,我们引入了“问题产生问题”(QbQ),这是一种可扩展的程序,教师可以将现有问题转化为各种变体,以探究相同的基础技能;为了模拟神谕推理的缺失,我们专门通过强化学习对问题陈述和最终答案进行训练,而不是对教师推理痕迹进行训练。然而,对此类数据的静态训练远未达到任务要求:真实加合成增强和非课程 QbQ 生成的合成数据训练上限 pass@1 分别为 12.5\% 和 14.5\%,尽管数据大幅增加。我们的主要发现是这个上限并不是模型固有的。我们提出了一种自我进化的课程,每一轮都会评估当前的检查点,从大多数可以正确解决的问题中种子 QbQ,并对所得的变体进行训练;在相同的数据预算下,这打破了上限,将 pass@1 提升到 16.5\%,20 轮后没有饱和的迹象。与直觉相反,我们发现,当模型针对大多数可以正确解决的问题变体进行训练时,模型会得到改善,并且以这种方式训练的模型可以继续解决训练期间从未见过的更难的问题。