论文

用于 3D 计算机断层扫描的以疾病为中心的视觉语言预训练和混合视觉编码

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

模型训练预训练

摘要

视觉语言 预训练 (VLP) 通过利用放射学报告作为丰富的文本监督,为通用医疗 AI 带来了巨大的希望,但由于视觉主干效率低下和语义对齐粗糙,现有方法在 3D CT 成像方面遇到了困难。为了解决这些问题,我们提出了一个定制的 VLP 框架,具有三个关键组件:(1)CNN-ViT 混合编码器,用 3D CNN 主干取代 ViT 的补丁嵌入,以有效捕获局部解剖细节,同时保留全局注意力以及与预训练的跨模态先验的兼容性; (2)疾病级对比学习机制,使用可学习的查询标记从完整报告中动态提取特定于疾病的语义,并将其与相应的视觉特征对齐,从而理清同一解剖区域内的不同疾病; (3) 诊断感知提示策略,采用真实的临床短语和聚合的疾病原型来弥补 预训练 推理差距并提高零样本诊断的可靠性。我们的模型在 CT-RATE(84.4% AUC,+5.1%)和 Rad-ChestCT(75.4% AUC,+5.4%)上实现了最先进的性能,在具有挑战性的 60 种疾病基准上获得了更大的收益(+9.8% AUC),并展示了对放射学报告生成的强大可移植性,强调了我们方法的通用性和临床实用性。