论文

质疑问题:维持推理模型的自我进化

Questioning the Questions: Sustaining Self-Evolution in Reasoning Models

模型训练合成数据

摘要

自进化推理模型从自己生成的问题中学习,但重复的自训练可能会导致性能崩溃。在本文中,我们研究了为什么性能在连续几轮中恶化以及如何维持自我进化。我们的分析确定了自生成问题中两个反复出现的质量问题:无效问题和相同数学问题的重复变体。首先,无效问题在各轮中变得更加普遍,答案一致性过滤进一步增加了它们在训练数据中的比例。其次,现有的基于词汇相似性的问题多样性控制可能会错过以不同方式表达的数学上等效的问题,这会导致后面的训练轮次中问题多样性崩溃。基于这些发现,我们引入了 R-Quest,它使用问题有效性和新颖性反馈来指导自我进化。我们首先训练求解器识别和拒绝无效问题,然后使用其判断来指导提问者奖励并过滤求解器训练数据。为了避免问题重复,我们使用冻结的基本模型来比较采样的问题对并提供新颖的反馈。根据经验,我们的方法在两个模型系列的数学推理、通用领域推理和代码生成的 12 个基准测试中始终保持最高的平均性能。此外,R-Quest 在十轮自我进化中保持稳定的性能增益,在最后一轮达到峰值,比 R-Zero 提高了 17.32 点。

质疑问题:维持推理模型的自我进化的原论文方法或结果图
图 1:七个数学基准的平均表现。 R-Quest每一轮都超过了R-Zero的峰值,并在第十轮达到峰值,领先17.32分。