论文
读取整个心脏:基于潜变量注意力掩码自编码器的多模态心脏表征学习
Reading the Whole Heart: Latent-Attention Masked Autoencoders for Multimodal Cardiac Representation Learning
摘要
心血管诊断依赖于整合多种模态,如心电图、超声心动图、胸部X光和临床变量,每种模态捕捉心脏生理的不同但相关的方面。然而,大多数医学基础模型仍为模态特定,仅在微调或后训练阶段融合模态,忽略了临床医生自然整合的跨模态证据以及各模态内部的结构。我们提出了一种多模态、结构感知的掩码自编码器——潜变量注意力掩码自编码器(LAMAE),在自监督预训练阶段联合学习患者级表征。不同于事后融合模态,LAMAE通过共享的潜变量注意力模块,在检查-视图-实体层次结构上直接在潜空间交换信息,实现数量可变观测的聚合,并能优雅处理缺失模态。在超过120万条MIMIC-IV医院住院记录上进行预训练,LAMAE在多模态住院任务(如住院死亡率、ICD-10和DRG编码、住院时长)上优于模态特定预训练及强对比学习和视觉-语言基线模型,同时在单模态任务上保持竞争力。即使在测试时仅提供单一模态,其性能优势依然存在,表明建模模态内与模态间结构能够产生更鲁棒、可迁移的表征。
