论文

推理竞技场:当可验证的奖励不足时进行跟踪锦标赛

Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

模型训练奖励建模与过程监督

摘要

具有可验证奖励的强化学习(RLVR)已成为通过基于结果的监督提高 大语言模型 推理能力的领先范例。然而,可验证的奖励在群体层面上经常变得缺乏信息:当给定提示的所有采样轨迹都收到相同的奖励时,群体相对优势估计不会提供梯度信号,即使轨迹在推理质量上可能有很大差异。我们提出 Reasoning Arena,这是一种自适应训练框架,它将此类非多样化奖励组路由到判断系统,而不是丢弃它们。除了检查最终答案之外,推理竞技场还构建了踪迹锦标赛,其中推理踪迹进行头对头比较,以揭示群体内更细粒度的偏好,将推理质量转化为丰富的相对奖励信号。为了使奖励估计更加高效,而不是详尽地比较每一对,而是针对一个小的、动态更新的先前生成的轨迹池作为锚点来评估每个新轨迹,以有效地建立相对排名。然后,我们在不完整的比较图上拟合 Bradley-Terry 模型,从而实现可扩展的 RL 集成,而无需二次成对比较。实证结果表明,Reasoning Arena 在竞赛数学和编码基准测试中始终比 RLVR 基线平均高出 7.6%。通过将浪费的零优势样本转换为有用的梯度更新,我们的方法将训练速度提高了 27% 至 41%,节省了近 50% 的生成计算,并显着提高了整体推理性能。