论文

用于检测引导的乳腺 X 线病变分类的基于区域的视觉语言学习

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

模型训练预训练

摘要

用对比目标训练的视觉语言模型在医学图像分析中显示出了前景。然而,传统的全局图像文本对齐不适合乳房X线照相术,其中诊断相关的病变在空间上是局部的并且仅占据图像的一小部分。当在整个图像水平上学习表征时,对恶性肿瘤评估至关重要的微妙形态学线索可能会被淡化。在这项工作中,我们提出了一种新颖的基于区域的视觉语言学习方法,用于检测引导的乳腺X线摄影病变分类。该方法反映了放射科医生的诊断范式。首先,区域文本对比预训练阶段将特定于病变的特征与源自放射学元数据的结构化临床描述符对齐。为了减轻低词汇量环境中的语义崩溃和背景偏差,我们引入了一个多组件目标,其中包含正对齐、细粒度语义硬负例和背景抑制。其次,辅助病变检测头与对比分类联合优化,以保持空间敏感性并实现定位感知的恶性肿瘤分类。对两个独立数据集 CBIS-DDSM 和 VinDr-Mammo 的广泛实验表明,与域内、跨数据集和迁移学习设置下的相关方法相比,我们的方法具有优越的性能。