论文
关注重要事项:利用乳房 X 光检查进行乳腺癌分类的视觉基础模型
Attend what matters: Leveraging vision foundational models for breast cancer classification using mammograms
摘要
Vision Transformer $(\texttt{ViT})$ 已成为许多计算机视觉任务的首选架构,但其在计算机辅助诊断中的性能仍然有限。重点关注乳房 X 光检查中的乳腺癌检测,我们确定了造成这种缺陷的两个主要原因。首先,医学图像分辨率高,存在小异常,导致标记数量过多,使得基于 softmax 的注意力难以定位和关注相关区域。其次,医学图像分类本质上是细粒度的,类间变异性低,类内变异性高,而标准交叉熵训练是不够的。为了克服这些挑战,我们提出了一个包含三个关键组件的框架:(1)基于感兴趣区域$(\texttt{RoI})$的标记减少,使用对象检测模型来引导注意力; (2) 选定的$\texttt{RoI}$之间的对比学习,通过基于硬负的训练来增强细粒度的辨别力; (3) $\texttt{DINOv2}$ 预训练的 $\texttt{ViT}$ 捕获本地化感知的细粒度特征,而不是全局 $\texttt{CLIP}$ 表示。对公共乳房X光检查数据集的实验表明,我们的方法比现有基线具有优越的性能,确立了其在大规模乳腺癌筛查中的有效性和潜在的临床实用性。我们的代码可在此处重现:https://aih-iitd.github.io/publications/attend-what-matters