论文
M-IDoL:医学基础模型中特定模态和多样化表征学习的信息分解
M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
摘要
医学基础模型(MFM)旨在从多模态医学图像中学习通用表示,这些表示可以有效地推广到不同的下游临床任务。然而,大多数现有的 MFM 都存在信息模糊性,将多模态表示混合在单个嵌入空间中,导致模态特异性和多样性的退化。在本文中,我们提出了 M-IDoL,一种自监督 MFM,它通过两个目标引入用于多模态表示学习的信息分解:i)通过将多模态表示分散到可分离的专家混合(MoE)子空间中来最大化模态间熵,以实现跨模态的表示特异性; ii) 通过在每个 MoE 子空间内执行细粒度语义区分来丰富每个模态的表示多样性,从而最大限度地减少模态内的不确定性。通过 预训练 在 115 万张医学图像上的表现,M-IDoL i) 在 21 个下游临床任务中提供了卓越的泛化能力,在五种成像模式(例如 X 射线、眼底、OCT、皮肤镜检查和病理学)上优于 20 个基础模型,ii) 学习模式特定和多样化的表示,显示出跨模式的特征集群更清晰的分离以及每个模式中更细粒度的特征区分情态。