论文

无需训练 遥感图像和视频的开放词汇视觉定位

Training-Free Open-Vocabulary Visual Grounding for Remote Sensing Images and Videos

应用与实践视觉感知与空间理解

摘要

遥感视觉定位(RSVG)旨在根据自然语言表达来定位遥感图像或视频中的参考目标。现有的 RSVG 方法通常依赖于特定于任务的手动注释,这些注释的收集成本很高,并且在覆盖现实世界地理空间场景的多样性方面不可避免地受到限制。因此,他们经常难以推广到涉及新颖对象、细粒度属性、复杂空间关系和功能语义的开放词汇查询。在本文中,我们提出了 RSVG-ZeroOV,这是一个 无需训练 框架,它利用冻结的通用基础模型来实现零样本开放词汇 RSVG。 RSVG-ZeroOV 遵循概述-焦点-进化范式,利用视觉语言模型 (VLM) 和扩散模型 (DM) 的独特但互补的注意力模式来逐步生成精确的基础结果。具体来说,(i)Overview 利用 VLM 来提取交叉注意力图,以捕获所指表达和视觉区域之间的语义相关性; (ii) Focus 利用 DM 的细粒度建模先验来补偿经常被 VLM 注意力忽略的对象结构和形状信息; (iii) Evolve 引入了一个简单而有效的注意力进化模块来抑制不相关的激活,从而产生纯化的对象掩模。为了处理视频输入,我们进一步提出了 Video RSVG-ZeroOV,它通过与查询相关的关键帧选择器和时间传播器将图像级基础扩展到时空基础,从而无需视频注释或 微调 即可实现高效且时间连贯的视频定位。对六个图像和视频定位基准的大量实验表明,RSVG-ZeroOV 始终优于现有的零样本基线,并且与弱监督和完全监督方法相比,实现了具有竞争力或优越的性能。