论文
超越不确定性:用多求解器分歧奖励实现推理课程自我演化
Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula
摘要
自我进化推理框架训练挑战者生成暴露解决者弱点的问题,从而创建无需人类数据的自适应课程。然而,现有方法使用单个求解器的采样不确定性作为挑战者的奖励。这就产生了一个根本性的瓶颈:随着求解器对挑战者的问题分布越来越有信心,所有采样的答案都会相同地收敛,将奖励压缩为零并使挑战者缺乏学习信号。至关重要的是,这种单一模型奖励无法区分真正简单的问题和那些仅仅符合一个解决者的习得偏差的问题。我们提出了使用模型容量和采样温度不同的异构集成的多求解器分歧奖励。集合的每个问题的多个答案的归一化香农熵明确地奖励求解器产生冲突解决方案的问题——将困难捕获为模型间分歧而不是模型内采样方差。这种更丰富的梯度使挑战者能够发现针对真正能力边界的问题,从而制定课程,迫使下游解决者开发出跨问题类型的强大推理策略。我们的方法是直接奖励函数替换,不需要框架修改或额外数据。 Qwen3-4B 的实验表明,接受分歧挑战者问题训练的求解器在竞赛数学基准(MATH-500、AMC、奥林匹克)上平均提高了 +1.34 分,这表明多求解器分歧为自博推理系统中的课程生成提供了补充和可扩展的信号。
