论文

MedCase-Structured:用于临床现实 EHR 设置中诊断推理基准测试的文本到 FHIR 数据集

MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings

模型评测基准与评测资源

摘要

大语言模型 (LLM) 显示出临床推理和决策支持的前景,但在结构化、电子健康记录一致的环境中进行评估仍然有限。现有的基准通常依赖于静态数据集或非结构化输入,这些数据集不反映临床系统中使用的可互操作的数据格式。我们引入了一个可重用的管道,用于从非结构化文本生成基于术语的 HL7 FHIR R4 包,从而能够通过结构化输入对临床决策支持系统进行可控评估。该管道将​​分阶段的 LLM 生成与基于术语的验证和修复相结合,以消除幻觉代码并增强结构和语义的一致性。将这种方法应用于 MedCaseReasoning,我们构建了 MedCase-Structured,这是一个由 1,732 个 FHIR 包组成的综合数据集,这些包源自临床医生编写的诊断病例​​,为 97.1% 的尝试病例生成完整、有效的包。对 MedCase-Structured 的评估显示,与纯文本相比,LLM 在结构化 FHIR 输入上的诊断准确性始终较低,这凸显了部署一致基准测试的重要性。