论文

基于临床的医学 LM 隐私评估

Clinically Grounded Privacy Evaluation of Medical LMs

模型评测安全与风险评测

摘要

医学语言模型(LM)可以记忆和重现受保护的健康信息,但隐私评估通常侧重于训练文本的恢复,而不是现实威胁模型下的披露。我们引入了一个基于临床的框架,该框架沿着对抗性访问的分级轴评估泄漏,范围从公开推断的人口统计数据到泄漏的笔记片段。在每一层,我们都会测量患者特定文本的逐字记忆和敏感诊断的语义泄漏。将该框架应用于持续对 378k 临床记录进行预训练的 LM,我们发现日常遇到的元数据(即姓名、出生日期、就诊日期、提供者名称和诊所地点)在患者的时间线和敏感诊断恢复中引发了很高的逐字记忆率(堕胎 AUROC 0.91,HIV 0.82)。与此同时,精确匹配的记忆可能夸大了披露的内容:36% 的记忆标记反映了模板化文档。我们的工作强调了纵向临床数据训练的风险,并为医学 LM 的上下文隐私评估提供了实用的、可重用的框架。