论文

GR-Ben:用于评估过程奖励模型的通用推理基准

GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models

模型评测基准与评测资源

摘要

目前,过程奖励模型(PRM)在测试时扩展方面展现出显著潜力。由于大语言模型(LLM)在处理广泛的推理和决策任务时常会产生有缺陷的中间推理步骤,PRM需要具备在真实场景中检测过程级错误的能力。然而,现有基准主要聚焦于数学推理,因而无法全面评估PRM在多样推理场景中的错误检测能力。为弥合这一差距,我们提出GR-Ben,一个专门用于评估PRM在两大主要推理领域(科学与逻辑)及九个子领域上表现的过程级基准。我们在涵盖PRM和LLM的22个多样化模型上进行了大量实验,并得出两个关键发现:(1) 在数学推理之外的领域,现有PRM和LLM的错误检测能力明显更弱。(2) 总体而言,PRM较不擅长识别知识型错误,而LLM在检测计算型错误方面表现较差。我们希望GR-Ben能促进面向通用领域的PRM后续研究,从而增强LLM的推理能力。

GR-Ben:用于评估过程奖励模型的通用推理基准
图1:与数学推理相比,PRM在逻辑推理和科学推理领域的错误检测性能明显较低。