论文

通过患者感知采样预训练 EHR 基础模型

Pretraining EHR Foundation Models with Patient-Aware Sampling

模型训练预训练

摘要

电子健康记录 (EHR) 的自回归基础模型通常继承语言建模的预训练方法,其中患者轨迹连接到单个词元流中,并从该流中采样窗口。在 EHR 数据中,这种选择是重要的:窗口可能会混合多个患者,并且记录较长的患者会贡献更多的优化更新,从而可能会引入偏差。我们提出了患者采样,这是一种预训练序列构建方法,使我们能够控制训练信号在患者之间的分布方式。我们将此方法与标准方法(我们称之为全局流)进行比较。我们证明,具有可控权重的随机患者抽样可以提高现实世界 EHR 数据的性能。在 MIMIC-IV v2.2 和 v3.1 的下游临床任务中,患者采样在 Global Stream 基线上改进了 Macro AUROC 和 AUPRC。这些结果表明,训练和验证序列构建是自回归 EHR 基础模型的重要且尚未充分探索的设计选择。