论文

GeoSeg-OV:通过开放词汇遥感分割的结构指导来弥合地理空间差距

GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation

应用与实践视觉感知与空间理解

摘要

开放词汇遥感分割最近成为一种有前途的范例,它能够对自然语言指定的任意类别进行像素级识别,包括训练期间未见过的类别。然而,异构区域、空间分辨率和采集平台引起的地理空间域转移削弱了视觉文本匹配并限制了跨数据集泛化。最近的尝试已经开始合并辅助视觉基础模型(VFM),通常将其特征与文本嵌入结合起来作为额外的匹配证据。然而,这种策略可能会引入不一致的匹配信号,同时使 VFM 的结构敏感表示得不到充分利用。因此,我们提出了 GeoSeg-OV,它将辅助 VFM 特征与视觉文本匹配解耦,并将其重新用作成本聚合和解码的结构指导。 GeoSeg-OV 从多旋转 CLIP 特征构建方向稳健的成本量,而冻结的 VFM 并行提取多尺度结构敏感特征。我们提出了结构引导聚合(SGA),它将成本标记和 CLIP 语义指导与 VFM 派生的成对结构偏差相结合,以实现连贯的空间传播,然后进行文本条件的类推理。我们进一步引入成本感知解码(CAD),以根据当前解码器上下文自适应地细化和融合多尺度语义和结构指导。在跨越六大洲七个数据集的全球高分辨率土地覆盖 (HRLC) 基准上,GeoSeg-OV 在两种训练设置下的平均 mIoU 分别比最先进的水平高出 +2.5 和 +2.7。大规模的零样本案例研究进一步证明了其跨地理域和类别系统的泛化性,无需目标域注释或再训练。