论文
Reasoning Jury:评估推理轨迹的多模型共识
Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces
摘要
改进推理型大语言模型需要判断长推理轨迹质量的能力,以支持有效的推理数据整理、强化学习期间强的训练信号,以及模型性能评估中对推理行为的深入理解。此外,揭示模型所犯的推理错误可以通过提供反馈在运行时改进模型性能。由于在长推理轨迹上这一复杂任务的困难性,单模型评审(即使是前沿模型)难以很好地识别推理缺陷。此外,由于使用条款中的防护限制,在推理型大语言模型的在线训练中利用前沿模型通常被禁止。在本工作中,我们提出Reasoning Jury,该系统以一组LLM评审团和有主持人的共识机制取代单一评审,以提高识别推理缺陷判断的保真度。在Reasoning Jury中,推理轨迹的缺陷及其严重程度通过一场商议揭示:主持人组织评审团内部讨论,评审相互批评彼此的判断并可修改初始投票。主持人通过评审间的商议或判断整合得出共识。我们表明,由开源权重模型(如gpt-oss-120b)组成的Reasoning Jury在正确识别推理缺陷上显著优于前沿模型(opus-4.6、sonnet-4.6与gemini-3.1-pro)。除准确率提升外,评审团的总成本(初始裁决、商议、整合等)仅为在LLM作为评审设置下运行前沿模型成本的8%到15%。我们还展示了如何利用这些判断来理解推理型大语言模型在基准上的失败模式,从而更深入地理解模型性能。