论文

DINO 腾飞:DINOv3 用于遥感图像的开放词汇语义分割

DINO Soars: DINOv3 for Open-Vocabulary Semantic Segmentation of Remote Sensing Imagery

应用与实践视觉感知与空间理解

摘要

遥感(RS)领域缺乏密集标记的数据集,而获取这些数据集的成本很高。因此,无需监督 微调 即可很好地分割遥感图像的模型是有价值的,但现有的解决方案落后于监督方法。最近,DINOv3 在 GEO-bench 分割基准上超越了 SOTA RS 基础模型,而 RS 数据上没有 预训练。此外,DINO.txt 还启用了具有 DINOv3 主干的开放词汇语义分割 (OVSS)。我们利用这些进展形成了 RS 图像的 OVSS 模型,不受 RS 域 微调 的影响。我们的模型 CAFe-DINO(使用 DINO 进行成本聚合 + 特征上采样)通过成本聚合和文本图像相似度分数的 无需训练 上采样,利用 DINOv3 强大的 OVSS 性能来处理 RS 图像。 DINOv3 主干网的强大潜力消除了 RS 图像上对 微调 的需求;相反,我们在 COCO-Stuff 的 RS 目标子集上微调我们的模型。 CAFe-DINO 在关键 RS 分割数据集上实现了最先进的性能,优于在 RS 数据上微调的 OVSS 方法。我们的代码和数据可在 https://github.com/rfaulk/DINO_Soars 上公开获取。