论文
Ultrasound-CLIP:用于超声图像文本理解的语义感知对比 预训练
Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding
摘要
超声成像由于其实时性和无辐射特性而广泛应用于临床诊断。然而,现有的视觉语言 预训练 模型(例如 CLIP)主要是为其他模态设计的,很难直接应用于表现出异构解剖结构和多样化诊断属性的超声数据。为了弥补这一差距,我们构建了 US-365K,这是一个大规模超声图像文本数据集,包含 52 个解剖类别的 365k 配对样本。我们建立了包含两个分层知识框架的超声诊断分类法(UDT)。超声分级解剖分类标准化了解剖组织,超声诊断属性框架形式化了九个诊断维度,包括身体系统、器官、诊断、形状、边缘、回声、内部特征、后声现象和血管分布。在此基础上,我们提出了 Ultrasound-CLIP,这是一种语义感知对比学习框架,它引入了语义软标签和语义损失来改进样本区分。此外,我们构建了一种源自 UDAF 文本表示的异构图模态,从而能够对病变属性关系进行结构化推理。患者级数据分割的大量实验表明,我们的方法在分类和检索基准方面实现了最先进的性能,同时还为零样本、线性探测和 微调 任务提供了强大的泛化能力。