论文
DART:手术视觉基础模型的深度为目标预训练
DART: Depth-as-Target Pretraining for Surgical Vision Foundation Models
摘要
视觉基础模型 (VFM) 在手术等数据稀缺领域非常有价值,其中单个预训练主干可以为许多下游任务提供丰富的表示。然而,占主导地位的自监督预训练范式仅使用 RGB 图像,而未使用容易获得的互补信号,例如深度图。这是外科手术中一个特别错失的机会,其中自然图像 VFM 传输很差,而场景几何形状丰富且信息丰富。现在,强大的现成模型能够为任何图像语料库生成伪标记的密集深度,我们假设这些信号可以合并到预训练中以学习更好的表示。我们提出了 DART,一种基于 DINOv2 构建的 RGB-D 预训练方法,并进行了简单的修改:将像素空间深度重建目标应用于蒙版 iBOT 补丁,并由伪标记深度进行监督。深度仅在预训练期间使用,因此 微调 和推理仍然仅使用 RGB。我们发现这种像素级重建头提高了表示质量而不是破坏它。我们进一步表明,对场景几何进行编码的深度作为目标比 Canny 边缘等替代密集信号更有效,这证实了增益源于深度而不是单独添加监督。在跨越分割、深度估计和图像级识别的八个外科基准中,DART 的性能优于自然图像和域内基线,包括在相同数据上训练的普通 DINOv2,改进了密集预测,同时也加强了图像级理解。更广泛地说,DART 表明,免费提供的几何伪标签可以加强基础模型预训练,而无需额外标签或增加推理成本,为手术指明了更强大的支柱。