论文

机构特定的 LLM 提示恢复去识别系统及其黄金标准都错过的 PHI

Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss

模型评测模型能力评测

摘要

电子健康记录的二次使用需要去识别化,但现有系统遗漏了\emph{机构内}受保护的健康信息 (PHI),例如医院缩写、建筑物名称和其状态由本地确定的内部代码。我们询问带有上下文学习 (ICL) 的 大语言模型 (LLM) 是否可以缩小这一差距并控制精确率与召回率的权衡。在来自德克萨斯儿童医院的 100 个带注释的儿科肿瘤学笔记(5,322 个 PHI 范围)中,我们针对两个专用系统(Stanford TiDE、OpenMed PII)和两个基于模式的基线对 8 个 LLM 进行了基准测试。每个 LLM 都在三个不断增加的特异性提示下运行:(1) 符合 HIPAA 的基线,(2) 基线加上它错过的机构 PHI 类别,以及 (3) 提示 2 加上针对过度编辑临床内容的说明。然后,我们将 14~多代理和整体配置与最佳单一提示进行比较,并回顾主要安全指标。 LLM 优于专用系统(最佳 F1=0.918$\pm$0.001 vs.\ TiDE 0.779),优势集中在上下文类别。命名丢失的类别可以恢复其中的 79% (48/61),并且阻止过度编辑可以恢复精确度。没有代理架构击败校准的单遍提示(F1 0.906--0.907),但 LLM 输出出现 414~候选注释间隙;重新注释确认了227~PHI跨度,最终提示达到recall=0.981(F1=0.907$\pm$0.002)。经过良好校准的 ICL 解决了机构 PHI 差距和每张纸币一次 LLM 调用中的精确召回权衡。 LLM 的运行成本比传统方法更高,但这种成本购买了一种审核参考标准的方法。 LLM 是专用去识别系统的合法、适应性强的替代方案;针对具体机构的快速发展应该是主要的适应策略。