论文

超越不确定性:用多求解器分歧奖励实现推理课程自我演化

Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula

模型训练强化学习

摘要

自我进化推理框架训练挑战者生成暴露解决者弱点的问题,从而创建无需人类数据的自适应课程。然而,现有方法使用单个求解器的采样不确定性作为挑战者的奖励。这就产生了一个根本性的瓶颈:随着求解器对挑战者的问题分布越来越有信心,所有采样的答案都会相同地收敛,将奖励压缩为零并使挑战者缺乏学习信号。至关重要的是,这种单一模型奖励无法区分真正简单的问题和那些仅仅符合一个解决者的习得偏差的问题。我们提出了使用模型容量和采样温度不同的异构集成的多求解器分歧奖励。集合的每个问题的多个答案的归一化香农熵明确地奖励求解器产生冲突解决方案的问题——将困难捕获为模型间分歧而不是模型内采样方差。这种更丰富的梯度使挑战者能够发现针对真正能力边界的问题,从而制定课程,迫使下游解决者开发出跨问题类型的强大推理策略。我们的方法是直接奖励函数替换,不需要框架修改或额外数据。 Qwen3-4B 的实验表明,接受分歧挑战者问题训练的求解器在竞赛数学基准(MATH-500、AMC、奥林匹克)上平均提高了 +1.34 分,这表明多求解器分歧为自博推理系统中的课程生成提供了补充和可扩展的信号。

超越不确定性:用多求解器分歧奖励实现推理课程自我演化:论文配图
图1我们的框架概览,它扩展了R-Zero(Huang等人,2025年)挑战者-Solver共同革命结构。顶端( Challenger 培训): 挑战者生成的问题被发送到由三种冷冻求解器变异体组成的多种组合中。每种变体都独立地产生多元的答案;它们被分为两个不同的奖励途径-Runcrtext{unc(所有样品都有不确定性)和rdisrtext{dis(通过香农正统化而出现差异)。综合奖赏促使GROPO更新挑战者政策。底部( 类比训练): 解答器使用多数人投票的伪标签, 接受来自分歧- 搜索器的过滤问题培训 。