论文

CA-GCL:跨解剖学全局-局部对比学习,实现稳健的 3D 医学图像理解

CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding

模型训练预训练

摘要

细粒度视觉语言 预训练 (FVLP) 通过将解剖级视觉表示与相应的文本描述对齐,展示了 3D 医学图像理解的巨大潜力。然而,现有的 FVLP 范式经常在文本嵌入空间中遭受严重的表示崩溃,其中不同解剖结构的文本嵌入变得高度聚集且难以区分。这种分布简并性使得模型对即时变化高度敏感,从而阻碍了可靠的临床部署。为了应对这些挑战,我们提出了一种新颖的跨解剖全局局部对比学习框架(CA-GCL)。 CA-GCL引入了全局对比目标,强制潜在空间中解剖类别之间的分离,有效地抵消了局部对齐引起的聚集趋势。此外,我们结合了基于排列不变性和部分完整性的临床感知文本增强策略,以增强针对描述性不完整性的鲁棒性。对 CT-RATE 和 Rad-ChestCT 数据集的广泛评估表明,CA-GCL 实现了与现有 VLP 范式相当的零样本异常检测性能,同时对提示变化表现出明显更好的鲁棒性:在规范模板上,它获得了更高的平均 AUC 和更低的方差,在非规范模板上,它保持稳定,而基线显着下降。这些结果验证了 CA-GCL 作为强大的 3D 医学图像理解的有效框架。