论文
使用 大语言模型 从芬兰电子健康记录中自动检索临床信息
Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models
摘要
临床医生经常需要从电子健康记录 (EHR) 中检索患者特定信息,这是一项耗时且容易出错的任务。我们提出了一个可本地部署的临床上下文问答 (CCQA) 框架,可直接从 EHR 回答临床问题,无需外部数据传输。开源 大语言模型 (LLM) 范围从 4B 到 70B 参数,在完全离线条件下使用源自 183 名患者记录的 1,664 个专家注释的问答对进行基准测试。该数据集主要由芬兰临床文本组成。在自由文本生成中,Llama-3.1-70B 在语义等效的问题变体中实现了 95.3% 的准确率和 97.3% 的一致性,而较小的 Qwen3-30B-A3B-2507 模型则实现了相当的性能。在多项选择设置中,模型显示出相似的精度,但校准存在差异。低精度量化(4 位和 8 位)保留了预测性能,同时降低了 GPU 内存需求并提高了部署可行性。临床评估发现 2.9% 的输出存在临床显着错误,语义等效的问题有时会产生不一致的反应,包括一种表述正确而另一种包含临床显着错误的情况(0.96% 的案例)。这些发现表明,本地托管的开源 LLM 可以使用自然语言查询从 EHR 准确检索患者特定信息,同时强调临床部署中验证和人工监督的需要。