论文
Agon:具有隐式竞争推理评分的竞争性跨模型强化学习
Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
摘要
来自可验证奖励(例如 GRPO)的强化学习是当今推理模型背后的引擎,但它仅对最终答案进行评分。在解决困难问题时,这会训练模型写更多而不是更好地思考,因为轨迹本身永远不会被评分,并且不存在良好思维的标签。我们介绍 Agon,它使两个竞争模型成为彼此的评分者。两者都尝试同样的问题;在交替角色中,一个起草解决方案,另一个在解决问题时阅读该解决方案,并且每个人都会因解决另一个问题而获得奖励。为了获胜,模型必须推理出已经看过其工作的竞争对手,因此推理是在训练过程中隐式判断的,没有过程标签,也没有奖励模型。由于这两个模型都经过了优化,因此每个模型都面临着越来越强大的竞争对手,这是单模型强化学习无法提供的。两者只需要相当强大并且行为上不同即可。在推理时,这对模型在训练时进行部署,这是一个两阶段级联,其中一个模型起草草案,另一个模型在阅读草案后做出回答。在 DeepMath 与 Qwen3 的硬分割上,这使 GRPO 的 pass@1 翻倍,大约是未经训练的 Mixture-of-Agents pass 在同一基础上的增益的八倍。该顺序在竞争性编程代码和跨模型系列(Qwen3.5、Gemma 4)上重复。目前,模特们用文字说话;下一步是让他们在潜在空间中一起推理。