论文

SHIELD:用于企业规模去识别的多样化临床记录数据集和精炼的小语言模型

SHIELD: A Diverse Clinical Note Dataset and Distilled Small Language Models for Enterprise-Scale De-identification

摘要

临床文本的去标识化是电子健康记录二次利用的前提。现有的公共基准(例如 i2b2 2006 和 2014 语料库)已有十多年历史,缺乏现代临床叙述的语义和人口统计多样性。 大语言模型 (LLM) 达到了最先进的零样本提取,但它们在企业规模的使用受到计算成本和限制将受保护的健康信息 (PHI) 发送到云 API 的医院数据治理的限制。我们引入了 SHIELD(用于学习和去识别的合成人类注释标识符替换条目),这是一个包含 1,381 个注释的多样化临床记录数据集,其中包含 10,229 个黄金标准 PHI,涵盖 9 个类别,通过跨人口统计和文档类型层的集合覆盖多样性采样和人机循环裁决而构建。我们评估了四个 LLM(两个专有的,两个开放权重)以在 SHIELD 上建立性能上限,然后表明师生 蒸馏 框架将这些功能转移到本地可部署的小语言模型中。我们最好的蒸馏模型在标准工作站硬件上运行时,微平均跨度精度达到 0.89,召回率达到 0.88。它在每个类别的召回率上落后于其云老师(宏观平均为 0.90 vs. 0.81),但由于其较低的成本和本地部署能力,它仍然具有竞争力。跨数据集评估表明,经过多样性训练的模型在通用结构化 PHI 类别上具有良好的泛化能力,而特定于机构的实体仍然难以在两个方向上转移,这表明将广泛覆盖的模型与针对大容量、半结构化票据类型的专用模型配对。我们公开发布 SHIELD 数据集和经过提炼的 DeBERTa v3 模型,以提供准确、经济高效的去识别管道,可完全部署在机构防火墙后面。