用于评估 大语言模型 临床注册抽象性能的模糊分类法:一项多中心前瞻性研究
An ambiguity taxonomy for evaluating large language model performance on clinical registry abstraction: a multi-site prospective study
摘要
目的:评估 大语言模型 (LLM) 在用于临床登记抽象的未处理电子病历 (EMR) 数据上的性能。方法:我们评估了 LLM 回答美国心脏病学会国家心血管数据注册中心 (ACC NCDR) 注册问题的表现。在学术医疗中心的一项试点研究中,该模型确定了每个注册问题的候选数据源,经验丰富的抽象者使用这些结果来定义特定于问题的文档集。在具有第二个 ACC NCDR 注册中心的第二个中心进行的验证研究中,LLM 使用特定于问题的文档集回答了问题。在审查任何输出之前,两名摘要者独立建立了 真值,并将每个问题分配给六个类别之一,并按解决问题所需的歧义性和临床推理进行排序:药物/事件标记、二元临床存在、管理、定量实验室/生理、临床解释和事件计时。结果:分析样本包含 9,430 个摘要答案,与 4,715 个共识答案相协调(501 个试点;4,214 个验证)。在试点中,每个问题的候选数据源的人口统计数据平均为 14.6 (SD 13.9),病史和风险因素平均为 89.2 (SD 56.1)。在验证中,人类评估者间的一致性约为 98\%,而 LLM 答案中 87\% 完全匹配共识,2\% 部分匹配,9\% 不匹配。在至少有 20 个答案的 157 个问题中,平均问题级准确度为 91.5\% (SD 13.4\%),并且随着模糊性的增加而下降,从药物/事件标记的 96\% 到事件计时问题的 62\%。结论:LLM 针对未处理的 EMR 数据回答临床登记问题的准确性远低于人类提取者。随着歧义性和所需临床推理水平的提高,LLM 准确性稳步下降。