论文

TIDE 2.0:临床记录的模型无关密钥去标识引擎

TIDE 2.0: an open, model-agnostic engine for keyed de-identification of clinical notes

AI 基础设施AI安全与内容治理基础设施

摘要

临床记录包含患者诊疗中大部分已记录的信息,但研究使用前必须移除受保护健康信息(PHI)。去标识化常被视为检测问题,但仅检测并不够:直接遮删会连同标识符一起删除临床内容,清空日期破坏纵向分析所需的时间间隔,每次出现都分配新随机替代值则破坏同一患者记录之间的关联。我们提出MIT许可的TIDE 2.0,包含可分离的可替换识别器与密钥驱动匿名器,两者均在机构自有硬件运行。替代值用密码学方式生成,无需保存关联表。日期按每位患者固定偏移,保留时间间隔;同一密钥下,相同值的每次出现均得到相同替代值;新密钥生成的发布数据不能与旧版本关联。我们还发布从大语言模型蒸馏的识别器TIDE2-Sentry。在两家机构的两个人工金标语料库上,默认配置的片段级召回率分别为域内0.88和另一机构0.77,精确率分别为0.88和0.87。除汇总指标外,我们报告各类别的召回率与精确率。引擎开源,识别器需按受控研究使用协议获取,机构可在自身环境运行、检查和扩展两者。

TIDE 2.0:临床记录的模型无关密钥去标识引擎:论文原图
图 4:组件架构。识别器插槽接受Transformer token 分类器、LLM 识别器、正则表达式和 Aho-Corasick 地名词典; span解析将RecognizerResult列表传递给匿名器,匿名器在“相同输入$+$相同密钥$=$相同输出”规则下应用键控代理模型、格式保留加密、散列和每个患者的日期抖动。 Ray 数据层通过加密基础提供 GPU 和 CPU 执行模型、记忆之外的批量分割和检查点。