论文

读取整个心脏:基于潜变量注意力掩码自编码器的多模态心脏表征学习

Reading the Whole Heart: Latent-Attention Masked Autoencoders for Multimodal Cardiac Representation Learning

模型架构新型架构

摘要

心血管诊断依赖于整合多种模态,如心电图、超声心动图、胸部X光和临床变量,每种模态捕捉心脏生理的不同但相关的方面。然而,大多数医学基础模型仍为模态特定,仅在微调或后训练阶段融合模态,忽略了临床医生自然整合的跨模态证据以及各模态内部的结构。我们提出了一种多模态、结构感知的掩码自编码器——潜变量注意力掩码自编码器(LAMAE),在自监督预训练阶段联合学习患者级表征。不同于事后融合模态,LAMAE通过共享的潜变量注意力模块,在检查-视图-实体层次结构上直接在潜空间交换信息,实现数量可变观测的聚合,并能优雅处理缺失模态。在超过120万条MIMIC-IV医院住院记录上进行预训练,LAMAE在多模态住院任务(如住院死亡率、ICD-10和DRG编码、住院时长)上优于模态特定预训练及强对比学习和视觉-语言基线模型,同时在单模态任务上保持竞争力。即使在测试时仅提供单一模态,其性能优势依然存在,表明建模模态内与模态间结构能够产生更鲁棒、可迁移的表征。

读取整个心脏:基于潜变量注意力掩码自编码器的多模态心脏表征学习:论文配图
图 1:LAMAE 框架概述。给定多模态输入(ECG、CXR 和 Echo,左),标记在补丁级别和完整实体级别都被屏蔽,例如,删除整个导联或视图(第二个面板)。特定于模态的编码器 EphikE_{\phi_{k}} 将每种模态的可见标记独立嵌入到潜在嵌入中,然后共享潜在注意模块 L​AphiLA_{\phi} 跨模态联合处理。特定于模态的解码器 DphikD_{\phi_{k}} 从结果表示中重建完整的、未屏蔽的输入(右)。