论文

FM$^2$:异构多模态医学成像的统一联邦基础模型

FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging

摘要

构建医学成像基础模型需要跨机构汇集数据,但隐私法规禁止集中聚合。现有的联合基础模型要么对医疗领域传输较差的自然图像模型进行微调,要么在单一模式中从头开始训练,缺乏统一任务的灵活性。我们发现了一个尚未探索的挑战,即成像模态异质性,其中客户在两种结构体制下运作:重叠(具有异构标签分布的共享模态)和非重叠(每个客户完全不相交的模态)。我们提出了 FM$^2$,这是一个统一的框架,可以从头开始训练核心骨干,以保持医学领域的保真度,同时可选地合并生物医学预训练编码器以进行视觉语言对齐。 FM$^2$ 为每个客户端配备了双专家混合模块(用于个性化类别知识的类明智 MoE 和用于共享跨模态表示的领域明智 MoE),再加上异构模态对齐 (HMA) 正则化器,该正则器显式对齐特定于模态的专家参数,允许可证明的 $O(1/\sqrt{T})$ 收敛和泛化保证。 FM$^2$ 进一步结合了图像描述增强学习 (CEL),其中本地保留的 GPT-4o 生成的图像描述充当文本语义桥梁,支持以不相交模式在客户端之间进行表示传输,并展示了联邦医疗 VQA 的可扩展性。我们的 MIMH 基准(分类和 CEL)和现实世界的医学 VQA 数据集上的实验证实了相对于最先进的联合基线的一致优越性以及在所有三项任务中的强大的模外泛化。