论文
一个可持续演进的电子健康记录信息检索基准
A Living Benchmark for Information Retrieval from Electronic Health Records
摘要
基于大语言模型(LLM)的临床助手正日益被集成到电子健康记录(EHR)系统中,改变着临床医生从患者病历中检索与综合信息的方式。它们的安全性与实用性取决于严格的评估,但现有基准依赖人工整理、更新成本高,并随技术演进而迅速过时。我们提出一个可扩展的框架,可从纵向EHR记录中自动生成问答对。19名临床医生对该基准生成器进行了验证,产出了EHR信息检索基准(BRIE)——一个可持续维护的评估数据集。在9个LLM和5种推理策略的评测中,最先进的系统经常遗漏临床上重要的信息,尤其是需要跨多份文档和多次就诊进行综合的问题。由于生成器本身经过验证,BRIE能够支持静态基准无法实现的评估,包括生成多个反映临床医生推理差异的答案以进行稳健的性能评估,以及持续刷新基准内容以防数据泄漏。我们的结果表明,可扩展的基准生成能够在临床LLM部署于快速演进的医疗环境时,为其提供严格且即时的评估。
