论文

当病例变得罕见时:超指南临床问答的检索基准

When Cases Get Rare: A Retrieval Benchmark for Off-Guideline Clinical Question Answering

模型评测基准与评测资源

摘要

在各个医学专业中,临床实践都以循证指南为基础,这些指南编纂了最佳研究的诊断和治疗途径。这些途径通常无法满足指南中未涵盖的现实世界护理的长尾要求。然而,大多数医学 大语言模型 (LLM) 经过训练,可以在其参数中编码常见的、以指南为中心的医学知识。当前的评估主要测试模型的记忆内容的回忆和推理,通常是在多项选择的设置中。鉴于循证推理在医学中的根本重要性,在实践中依赖记忆既不可行也不可靠。为了解决这一差距,我们引入了 OGCaReBench,这是一个以自由形式检索为中心的基准,旨在评估 LLM 回答需要超越典型指南的临床问题的能力。 OGCaReBench 摘自已发表的医疗案例报告并经过医学专家验证,包含需要自由文本答案的长篇临床问题,为评估罕见的基于案例的场景中的开放式医学推理提供了一个系统框架。我们的实验表明,即使是性能最好的基线 (GPT-5.2),也只能正确回答我们基准的 56%,而专用模型也只能达到 42%。使用检索到的医学文章增强模型可将性能提高高达 82%(使用 GPT-5.2),凸显了证据基础对于现实世界医学推理任务的重要性。因此,这项工作为通用和医疗 LLM 的基准测试和推进奠定了基础,以便在具有挑战性的临床环境中产生可靠的答案。