论文

ObGynLongBench:揭示纵向 EHR 决策中证据与 EHR 之间的差距

ObGynLongBench: Revealing the Evidence-to-EHR Gap in Longitudinal EHR Decision-Making

模型评测基准与评测资源

摘要

大语言模型(LLM)在个性化医疗助理中的应用引起了越来越多的兴趣。然而,现有的医疗基准在很大程度上依赖于预先选择的证据的静态问答,因此尚不清楚 LLM 是否可以根据真实的纵向电子健康记录 (EHR) 做出可靠的临床决策。为了弥补这一差距,我们引入了 ObGynLongBench,这是一个基于规则的长上下文 EHR 基准,用于妇产科决策,包含来自 976 个真实妊娠 EHR 历史的 1,500 个临床决策点案例和可追溯的规则。每个病例都与患者、怀孕时间线点和决策前信息边界相关,从而实现纯证据、就诊级别 EHR 和历史级别 EHR 评估。评估 17 LLM 揭示了证据与 EHR 之间的巨大差距:当直接提供证据时,模型表现良好,但当必须从当天记录或完整的决策前 EHR 历史记录中提取证据时,准确性会下降。进一步的分析发现证据利用是一个关键瓶颈:随着 EHR 环境的延长和证据要求的复杂化,性能会下降,并且早期的失败通常可以预测同一患者病史中的后续失败。最后,主动搜索代理在 EHR 访问策略中表现最佳,突出显示患者特定证据的利用是可靠的个性化医疗助理的核心挑战。资源可在 https://github.com/xiangjun2003/ObgynLongbench 获取。