论文
学习多模态医学视觉基础模型中的紧急模块化表示
Learning Emergent Modular Representations in Multi-modality Medical Vision Foundation Models
摘要
多模态医学视觉 (MV) 基础模型 (FM) 从根本上受到跨异构成像模态的明显非独立同分布特征统计的挑战。对此类数据的整体自我监督优化会引发冲突的梯度,从而导致表征崩溃,走向模态主导的捷径。这项工作将这种失败重新定义为新兴模块化中专业化和协调之间的不平衡,并提出了总监专家(DEX),这是一个模块化网络,可以明确调节堆叠模块中的这些动态。每个 DEX 模块都包含一组专家,由我们的图像激活策略动态调整,自主专门研究模态主导统计数据,以及一个通过我们的组指数移动平均线更新的控制器,将多专家知识提炼到共享空间中,以实现跨模态的语义集成,从而推动模块化表示的出现。我们策划了一个新的基准——Medical Vision Universe,包含 10 种模式的超过 400 万张图像,为我们的 DEX 提供了 FM 级 预训练,最大程度地覆盖了不同的成像模式。对 26 个下游任务的广泛评估证明了优化行为和可转移性的改进,表明 DEX 是迈向通用多模态医疗 AI 的原则性步骤。我们的代码和数据集将在 https://github.com/YutingHe-list/DEX 上开放。