论文
MedPRMBench:医学推理过程奖励模型的细粒度基准
MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning
摘要
过程级奖励模型 (PRM) 对于指导 大语言模型 中的复杂推理至关重要,但现有的 PRM 基准仅涵盖数学等一般领域,未能解决医学推理问题,而医学推理的独特特征是安全关键性、知识强度和多样化的错误模式。如果没有可靠的医学 PRM 评估框架,我们就无法量化模型在临床推理中的错误检测能力,从而导致其在现实医疗保健应用中的安全性未经验证。我们提出了 MedPRMBench,这是医疗领域的第一个流程级奖励模型基准。 MedPRMBench 通过基于临床推理蓝图 (CRB) 的三阶段管道构建,系统地从七个医学 QA 来源生成高质量的评估数据,涵盖三个类别(简单性、健全性和敏感性)的 14 种细粒度错误类型,并具有第一个 4 级严重性分级系统来量化临床影响。该基准包括 6{,}500 个问题、13{,}000 个推理链和 113{,}910 个步骤级标签,以及 6{,}879 个训练问题。我们的医疗 PRM 基线总体 PRMScore 达到 87.1%,大大超过所有基线,并作为即插即用验证器,将下游医疗 QA 准确性提高 3.2--6.7 个百分点。涵盖专有前沿模型、开源推理模型和医学专业模型的系统评估揭示了当前模型医学推理错误检测能力的关键弱点,为未来 PRM 的改进提供了明确的方向。