论文
MultiMedVision:多模式医学视觉框架
MultiMedVision: Multi-Modal Medical Vision Framework
摘要
多模态医学成像可实现全面的诊断,但当前的基础模型使用单独的、特定维度的架构来处理 2D(例如 X 射线)和 3D(例如 CT)数据。我们提出了 MultiMedVision,这是一个基于 Sparse Vision Transformer 的联合 2D/3D 表示学习的统一框架。我们的模型使用 3D 旋转位置嵌入和可变长度序列打包来在共享潜在空间内本地处理混合模态批次,无需模态特定的适配器或将 3D 体积视为 2D 切片序列。 MultiMedVision 通过胸部 X 射线 (MIMIC-CXR) 和 CT 扫描 (CT-RATE) 上的自监督目标进行训练,并使用数据量减少 5 倍的单个共享编码器,在 2D 基准(MIMIC 上的 Macro AUROC 0.82,CheXpert 上的 0.84)和 3D 任务(CT-RATE 上的 0.85)上实现了具有竞争力的性能。对学习到的表示的分析揭示了共存的特定模态和共享特征子空间,证明统一的跨维表示学习在不牺牲特定模态性能的情况下是可行的。