论文
用于遥感中 无需训练 开放词汇语义分割的独立 DINOv3
Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing
摘要
遥感语义分割受到昂贵的像素级注释的阻碍,激发了 无需训练 开放词汇方法。最近,最新发布的 DINOv3 带来了 DINO.txt,它为独立的 DINO 主干配备了图像文本对比学习,从而开启了开放词汇分割的可能性。我们提出了 DinoSplat-OV,这是一个 无需训练 框架,可将 DINOv3 应用于遥感,无需 微调 或额外的预训练。针对遥感影像分布密集、多尺度、大尺寸的特点,我们设计了两个核心模块。其文本感知拉普拉斯传播模块通过将文本语义亲和力与局部视觉相似性相结合来消除补丁级预测的噪声,在保留边界的同时提高区域一致性。其高斯泼溅上采样模块通过 RGB 引导的各向异性聚合和测试时间优化来重建像素级特征。全局锚滑动窗口策略进一步支持大规模图像。在 UDD5、DOTA 和 LoveDA 上的实验表明,其性能优于现有的 无需训练 方法,有效填补了 DINO 系列模型在 无需训练 开放词汇分割方面的空白,并为该方向的进一步发展提供了可行的新路径。