论文
使用 大语言模型 进行可信大规模临床信息提取的多阶段验证框架
A Multi-Stage Validation Framework for Trustworthy Large-scale Clinical Information Extraction using Large Language Models
摘要
大语言模型 (LLM)有望从非结构化健康记录中提取有临床意义的信息,但由于缺乏可扩展且值得信赖的验证方法,这些信息向现实世界环境的转化受到限制。传统的评估方法严重依赖注释密集型参考标准或不完整的结构化数据,限制了人口规模的可行性。我们提出了一个基于 LLM 的临床信息提取的多阶段验证框架,可以在弱监督下进行严格的评估。该框架集成了即时校准、基于规则的合理性过滤、语义基础评估、使用独立的高能力法官 LLM 进行有针对性的验证性评估、选择性专家评审和外部预测有效性分析,以量化不确定性并表征错误模式,而无需详尽的手动注释。我们应用该框架从 919,783 份临床记录中提取 11 种物质类别的物质使用障碍 (SUD) 诊断。基于规则的过滤和语义基础删除了 14.59% 的 LLM 阳性提取,这些提取不受支持、不相关或结构上不可信。对于高度不确定性的案件,法官 LLM 的评估与主题专家评审基本一致(Gwet 的 AC1=0.80)。使用法官评估的输出作为参考,初级 LLM 在宽松的匹配标准下获得了 0.80 的 F1 分数。 LLM 提取的 SUD 诊断还比结构化数据基线 (AUC=0.80) 更准确地预测随后参与 SUD 专业护理。这些发现表明,基于 LLM 的临床信息提取的可扩展、值得信赖的部署是可行的,无需注释密集型评估。