论文
EHRAdapt:以语义先验将预训练语言模型适配到罕见临床事件
EHRAdapt: Adapting Pretrained Language Models to Electronic Health Records with Semantic Priors for Rare Clinical Events
摘要
电子健康记录 (EHR) 将临床病史编码为(时间、模式、代码)元组,而预训练的语言模型则需要文本词元。将它们序列化为文本会增加序列长度并对结构进行冗余编码。我们引入了 EHRAdapt,一个将元组直接映射到冻结语言模型的嵌入空间的适配器。模态接收学习的嵌入,时间间隙通过学习的注意力偏差进入,事件代码接收专用向量。学习事件向量是主要挑战:临床词汇是长尾的,导致罕见事件的观察太少,无法进行可靠的估计。因此,EHRAdapt 将每个事件向量表示为语义先验和证据残差的总和。先验是来自经过临床本体训练的生物医学语言模型的事件临床描述的冻结嵌入,通过共享学习投影映射到模型的输入空间,因此即使观察很少,它也能提供临床意义。残差是一种习得的低秩事件特定校正,随着证据的积累而对其进行完善。我们使用三个冻结的 LLM 主干(OLMo2 1B、Llama3.2 1B 和 OLMo2 7B)对约 400 万患者记录进行持续预训练,仅训练适配器(所有参数的 0.1--0.6%)。完整的适配器在每个主干上的下一个事件预测中优于所有消融。删除语义路径对罕见事件的伤害是最常见事件的十倍以上,而删除残差会伤害整体预测,但会改善最罕见事件的预测。在可报告的传染病和综合征下游分类任务中,EHRAdapt 优于基于文本的 LLM 和基于计数的基线,并且这两种途径都改善了罕见疾病的区分能力。因此,这两条途径发挥着互补作用,只有当结果按事件频率而不是平均划分时才可见。