论文
LLM4EHR:通过 大语言模型 将临床时间序列与医疗事件序列对齐
LLM4EHR: Aligning Clinical Time Series with Medical Event Sequences via Large Language Models
摘要
临床机器学习的最新研究重点是重症监护病房 (ICU) 的结果预测,已从定制监督模型转向基础模型,利用现代表示学习方法。在这里,基础模型是根据复杂的临床数据模式的混合物进行预训练的,可用于各种下游任务。现有的工作经常利用电子健康记录(EHR)来提供丰富多样的患者观察结果来训练临床基础模型。然而,现有方法没有充分探索临床事件和 EHR 中记录的时间序列 (TS) 观察之间的共享时间结构。这种限制可能会导致临床基础模型的稳健性和适应性较差,从而导致下游任务的性能下降。为了充分利用这种时间结构,我们提出了 LLM4EHR,这是一种基于 ICU EHR 数据训练的新临床基础模型。将域适应的 大语言模型 与 Transformer TS 编码器相结合,我们通过暂时对齐 EHR 事件和 TS 来预训练 LLM4EHR。为此,我们提出了一个正则化的对比目标,以学习以适应领域 LLM 生成的 EHR 事件嵌入为条件的鲁棒 EHR TS 表示。在消融研究的支持下,我们发现从 LLM4EHR 学习的 EHR TS 嵌入可以提高各种下游临床任务的性能,并具有竞争性的性能。此外,我们凭经验证明 LLM4EHR 学习可转移的临床 TS 嵌入,可以通过 k-shot 适应部署到新队列。这些发现为构建更通用和高性能的临床基础模型迈出了一步。