论文

EHRBench:一个面向LLM临床决策的自动化且可靠的EHR基准

EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs

模型评测基准与评测资源

摘要

临床决策(CDM)是真实临床工作流程的核心,临床医生要在不完整的证据下推断诊断、选择治疗或预判未来健康结局。由于强大的语言能力、广泛的生物医学知识与高效率,LLM越来越多地被用于支持这些决策,但LLM在真实临床决策任务上的可靠性仍理解不足。为评估CDM模型,尤其是基于LLM的模型,一个理想且实用的医疗决策基准应通过自动化且可靠的流水线构建,以同时确保规模与质量。此外,将CDM基准扎根于真实患者的电子健康记录(EHR),能更好地支持对需要实质性生物医学知识与临床推理的实用CDM任务的评估。为填补这些空白,我们提出EHRBench,一个用于大规模评估基于LLM的临床决策的自动化、可靠的EHR扎根基准。为确保可扩展性与可靠性,EHRBench通过EHR-LLM-KB(知识库)交互流水线构建。为提高效率,我们使用专门的LLM自动将就诊级EHR轨迹转换为结构化模板,并确定性地将模板实例化为QA条目。与此同时,我们应用系统的基于KB的验证与增广,过滤幻觉或歧义关系并提高可靠性。借助该流水线,我们构建了近100万条(960,067)QA条目,覆盖三个需要推理的核心临床决策任务:诊断、治疗与预后。我们在EHRBench上对30多个代表性LLM进行基准测试,并给出性能与鲁棒性的详细分析。结果显示各设置下能力趋势一致,进一步验证了EHRBench的可靠性,并突显了迈向临床可靠LLM系统过程中可采取行动的差距。

EHRBench:一个面向LLM临床决策的自动化且可靠的EHR基准:论文配图
图 1.EHRBench 概述。 EHRBench 通过 EHR-LLM-KB 交互管道自动、可靠地将原始结构化 EHR 轨迹转换为 QA 基准,并评估代表性的 LLM 的三个核心临床决策任务:诊断、治疗和预后。