论文

SonoCLIP:用于胎儿超声分析的掩模引导区域感知视觉语言预训练

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

模型训练预训练

摘要

视觉语言基础模型在医学图像分析中显示出强大的潜力。尽管超声成像的基础模型最近已经出现,但由于严重的散斑噪声、采集变异性和微妙的解剖边界,导致观察者间的高度变异性,该领域仍然特别具有挑战性。现有的基于 CLIP 的模型主要依赖于全局图像文本对齐,限制了它们对临床决定性局部结构的敏感性。我们提出了 SonoCLIP,这是第一个百万级区域可控的胎儿超声视觉语言基础模型,它将分割掩模集成为视觉编码器中的掩模通道视觉提示,从而实现联合全局-局部对比表示学习。为了支持可扩展的区域文本对齐,我们引入了基于 sigmoid 的成对对比损失,可以提高大规模监督下的稳定性。我们进一步整理了一个跨越 24 个标准平面的 144 万图像多模态胎儿超声数据集,用于大规模预训练。广泛的跨中心评估表明,SonoCLIP 在全局和掩模引导推理下均实现了卓越的零样本传输性能,为胎儿超声分析建立了可控且面向临床的基础模型。我们的代码和数据可在 https://github.com/Harrison-one/SonoCLIP 获取。