论文

OptiSAR-Net++:跨域遥感视觉基础的大规模基准和无 Transformer 框架

OptiSAR-Net++: A Large-Scale Benchmark and Transformer-Free Framework for Cross-Domain Remote Sensing Visual Grounding

应用与实践视觉感知与空间理解

摘要

遥感视觉定位(RSVG)旨在使用自然语言表达来定位遥感图像中的特定目标。然而,现有方法仅限于单传感器域,即光学或合成孔径雷达(SAR),限制了它们的实际适用性。在本文中,我们介绍了跨域 RSVG (CD-RSVG) 任务并构建了 OptSAR-RSVG,这是该设置的第一个大规模基准数据集。为了解决跨域特征建模、计算效率低下和细粒度语义辨别的挑战,我们提出了 OptiSAR-Net++。我们的框架具有补丁级低秩适应专家混合(PL-MoE),可实现高效的跨域特征解耦。为了减轻 Transformer 解码框架的大量计算开销,我们采用基于 CLIP 的对比范式,并进一步结合动态对抗性负采样,从而将生成回归转化为高效的跨模态匹配过程。此外,还引入了文本引导双门融合模块(TGDF-SSA)和区域感知辅助头来增强语义视觉对齐和空间建模。大量实验表明,OptiSAR-Net++ 在 OptSAR-RSVG 和 DIOR-RSVG 基准上均实现了 SOTA 性能,在定位精度和效率方面具有显着优势。该模型和数据集已在 https://github.com/JunDong-dev/OptiSAR-Net-PlusPlus 上公开发布。