论文
ASAP:通过解剖感知语义自适应 预训练 推进医学体积表示学习
ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training
摘要
由于复杂的解剖结构和放射学报告提供的薄弱、异构的监督,从医学体积扫描中学习可转移和可解释的表示仍然具有挑战性。在本文中,我们提出了解剖感知语义自适应 预训练 (ASAP),这是一种有原则的视觉语言 预训练 框架,用于从大规模胸部 CT 扫描及其相应的放射学报告中学习细粒度的医学体积表示。 ASAP 集成了三个关键组件:(1)解剖感知知识注入模块,通过现成的分割工具整合器官级结构先验,以鼓励解剖学上连贯的表示; (2)语义自适应选择性对齐机制,将句子级发现与局部体积区域动态关联; (3)语义自适应融合模块,用于在双模态掩蔽建模范式下,解剖学视觉特征和视觉证据关联文本线索之间进行有效交互。除了方法论贡献之外,我们还为胸部 CT 医学体积视觉语言 预训练 建立了全面的基准,涵盖 15 个数据集和 22 个下游任务,涵盖异常分类、分割、疾病预后预测、报告生成、词汇分类、跨模态检索和视觉问答。该基准提供了标准化的评估协议,可以系统地评估不同临床环境和数据制度下的表征质量。大量实验表明,ASAP 在任务和数据集上始终如一地实现了最先进的性能,在有限的监督和分布转移下取得了特别明显的收益,验证了其在学习可转移和有临床意义的体积表示方面的有效性。