利用可微分子集采样解决乳腺X线摄影视觉语言模型中的大海捞针问题
Solving the Needle-in-a-Haystack Problem in Mammography Vision-Language Model with Differentiable Subset Sampling
摘要
人们越来越有兴趣采用 CLIP 式视觉语言模型 (VLM) 进行乳房 X 线摄影预训练。然而,直接采用标准 CLIP 架构和训练目标的模型在癌症、发现类型和 BI-RADS 预测等临床重要任务中表现出有限的零样本性能。我们认为,这种令人印象深刻的表现是由于忽视了乳房X光检查数据的两个特征:(1)其高分辨率性质,以及(2)放射学报告的同质性,这在很大程度上是由检查中阴性/良性结果占主导地位所驱动的。我们提出了 TopKSigLIP,这是一种 VLM,旨在通过新颖的架构和学习目标来解决这两个限制。 TopKSigLIP 不是缩小高分辨率乳房 X 线摄影图像以满足 GPU 内存限制,而是引入了 TopK-Patch 模块,该模块学习对可能包含病变的一组稀疏高分辨率补丁进行采样,从而回避了 VLM 训练的分辨率 - 批量大小权衡。采样的补丁位置还充当内置本地化工具。为了解决报告同质性问题,我们用 Sup-sigmoid 损失替换了对比损失,这种损失会错误地排斥语义上相似的对。 Sup-sigmoid 损失使用源自结构化数据的软标签扩展了 SigLIP 的 sigmoid 损失。 TopKSigLIP 在密度评估、BI-RADS 分类、发现子类型和零次评估下的癌症预测等内部和外部基准方面均优于现有的开源乳房 X 光检查和普通医学 VLM。尽管使用比基线小得多的视觉编码器和更小的训练批次,但 TopKSigLIP 在线性探测下仍然具有竞争力。与事后 Grad-CAM 相比,TopK-Patch 模块还实现了卓越的病变定位。代码和权重公开:https://github.com/Youngseok0001/TopKSigLIP。