论文
MedProbeBench:专家级医疗指南深度证据整合的系统基准测试
MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline
摘要
深度研究系统的最新进展使 大语言模型 能够检索、综合和推理大规模外部知识。在医学领域,临床指南的制定关键取决于这种深入的证据整合。然而,现有的基准无法在需要多步骤证据整合和专家级判断的现实工作流程中评估这种能力。为了弥补这一差距,我们推出了 MedProbeBench,这是第一个利用高质量临床指南作为专家级参考的基准。医学指南在中立性和可验证性方面具有严格的标准,代表了医学专业知识的顶峰,并对深度研究人员提出了巨大的挑战。为了进行评估,我们提出了 MedProbe-Eval,这是一个综合评估框架,其特点是:(1) 整体评分标准,具有 1,200 多个任务自适应评分标准,用于综合质量评估;(2) 细粒度证据验证,用于严格验证证据精度,基于 5,130 多个原子声明。对 17 个 LLM 和深度研究药物的评估揭示了证据整合和指南生成方面的关键差距,强调了当前能力与专家级临床指南开发之间的巨大差距。项目:https://github.com/uni-medical/MedProbeBench