论文
标记化电子健康记录的联合生成事件模型
Federated generative event models for tokenized electronic health records
摘要
电子健康记录基础模型受到机构孤立数据和跨站点传输下性能大幅下降的限制。我们评估了来自三个独立卫生系统的 122,251 例重症监护住院患者的标记化生成事件模型 (GEM) 的联合训练,这些模型与通用纵向 ICU 数据格式相协调。使用站点内、跨站点、集中式和联合训练配置对模型进行 12 个 24 小时后临床预测任务的评估。 GEM 实现了最高的平均站内和跨站 ROC-AUC,并且比传统的监督模型更具可移植性:它们的平均跨站惩罚为 0.025 ROC-AUC 和 0.027 PR-AUC,而 LightGBM 为 0.079 和 0.089。联邦学习(FedAvg 和 FedAvgM)接近集中式 GEM 训练的性能,大部分收益在 5-10 轮通信内获得。然而,与完整的本地训练相比,集中式多地点训练仅提供了适度的改进。当本地训练数据有限时,多站点模型最有用,但随着机构数据的积累,其优势逐渐缩小。这些发现表明,联合 GEM 训练在技术上是可行的,并且保留了最集中的性能,但主要的开放挑战是学习可传输的表示,以将来自多个卫生系统的更大但异构的数据转化为可靠的目标站点效益。