论文

SegDINO:在 DINO 中引入多尺度结构以实现高效的医学图像分割

SegDINO: Introducing Multi-Scale Structure into DINO for Efficient Medical Image Segmentation

模型架构Transformer

摘要

自监督 DINO 模型提供了强大的可转移视觉表示,但将它们直接应用于图像分割仍然具有挑战性。现有方法通常依赖于具有复杂上采样的重型解码器,引入大量参数和计算开销。我们观察到,在 DINO 特征中引入规模远比增加解码器容量更重要。在这项工作中,我们提出了 SegDINO,这是一种高效的分割框架,它将 DINOv3 主干与轻量级建模相集成。 SegDINO 引入了词元金字塔适应 (TPA),将中间 DINO 特征重新组织为伪多尺度层次结构,并引入了尺度感知解码 (SAD),以实现高效的尺度内细化和自上而下的多尺度传播。我们进一步整理了 PanCT,这是一个新的 CT 数据集,包含 284 名患有专家注释的胰腺肿瘤的患者,以评估 SegDINO 处理困难的小病变病例的能力。在 PanCT 和三个公共基准上的大量实验表明,SegDINO 以高效率实现了最先进的结果。代码可在 https://github.com/script-Yang/segdino_v2 获取。