论文

一个可持续演进的电子健康记录信息检索基准

A Living Benchmark for Information Retrieval from Electronic Health Records

模型评测基准与评测资源

摘要

基于大语言模型(LLM)的临床助手正日益被集成到电子健康记录(EHR)系统中,改变着临床医生从患者病历中检索与综合信息的方式。它们的安全性与实用性取决于严格的评估,但现有基准依赖人工整理、更新成本高,并随技术演进而迅速过时。我们提出一个可扩展的框架,可从纵向EHR记录中自动生成问答对。19名临床医生对该基准生成器进行了验证,产出了EHR信息检索基准(BRIE)——一个可持续维护的评估数据集。在9个LLM和5种推理策略的评测中,最先进的系统经常遗漏临床上重要的信息,尤其是需要跨多份文档和多次就诊进行综合的问题。由于生成器本身经过验证,BRIE能够支持静态基准无法实现的评估,包括生成多个反映临床医生推理差异的答案以进行稳健的性能评估,以及持续刷新基准内容以防数据泄漏。我们的结果表明,可扩展的基准生成能够在临床LLM部署于快速演进的医疗环境时,为其提供严格且即时的评估。

一个可持续演进的电子健康记录信息检索基准:论文配图
图 3:性能因模型和推理配置而异。报告每个模型-推理组合的平均 (a) 事实召回率和 (b) 事实精度。标记形状表示推理类型,颜色表示模型,实心标记轮廓标识每个系列中的较小模型。误差线代表平均值周围 95% 的置信区间。 (c) 根据每个模型-推理组合的推理成本绘制平均事实召回率。 (d-e) 成对获胜率总结了完整性、相关性和简洁性方面的相对性能:(d) 每个单元格显示 y 轴模型相对于 x 轴模型的获胜百分比(跨推理配置汇总),以及 (e) 每个单元格显示 y 轴推理类型相对于 x 轴推理类型的获胜百分比(跨模型汇总)。