论文
调整基础模型以实现电影图像中高效注释的附件质量分割
Adapting Foundation Models for Annotation-Efficient Adnexal Mass Segmentation in Cine Images
摘要
通过超声评估附件肿块是一项具有挑战性的临床任务,常常受到主观解释和观察者之间显着差异的阻碍。虽然自动分割是定量风险评估的基础步骤,但传统的完全监督卷积架构经常需要大量像素级注释,并且难以应对医学成像中常见的域转移。在这项工作中,我们提出了一种标签高效的分割框架,该框架利用预训练的 DINOv3 基础视觉 Transformer 主干的强大语义先验。通过将此主干与密集预测 Transformer (DPT) 式解码器集成,我们的模型分层重组多尺度特征,将全局语义表示与细粒度空间细节相结合。对来自 112 名患者的 7,777 个带注释的帧的临床数据集进行评估,与已建立的完全监督基线(包括 U-Net、U-Net++、DeepLabV3 和 MAnet)相比,我们的方法实现了最先进的性能。具体来说,我们获得了 0.945 的 Dice 分数,并提高了边界粘附性,相对于最强的卷积基线,将 95% 的 Hausdorff 距离减少了 11.4%。此外,我们进行了广泛的效率分析,证明我们基于 DINOv3 的方法在数据匮乏情况下仍能保持显着更高的性能,即使仅使用 25% 的数据进行训练,也能保持强劲的结果。这些结果表明,利用大规模自我监督基础为数据受限的临床环境中的医学图像分割提供了一种有前途且数据高效的解决方案。项目存储库:https://github.com/FrancescaFati/MESA