论文

ExACT:遥感图像中 无需训练 视觉定位的范例驱动校准细化

ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images

应用与实践视觉感知与空间理解

摘要

遥感视觉定位 (RSVG) 旨在使用自由形式的自然语言描述来定位高分辨率 RS 图像中的特定对象。虽然多模态 大语言模型 (MLLM) 的最新进展显示了这种开放词汇 RSVG 的巨大潜力,但它们的 无需训练 适应受到抽象语言语义和细粒度视觉线索之间模态差距的阻碍。在杂乱的遥感场景中,这种间隙不可避免地会导致严重的定位漂移。为了弥补这一差距,我们提出了 Exemplar 驱动的校准细化(ExACT),这是一种新颖的 无需训练 框架,由一次性视觉提示机制驱动,为精确的像素级定位明确提供有区别的结构指导。具体来说,我们提出了一种基于视觉范例的校准器(VEC),它从给定的范例中提取细粒度的视觉对应关系,以纠正冻结的 MLLM 的粗略跨模态先验,有效地抑制背景伪影并准确地勾勒出目标边界。随后,结构感知精炼器 (SAR) 采用迭代合并和选择聚类策略将校准先验合并为高质量的正负几何提示。然后,这些提示会指导分段任意模型 (SAM) 实现精确的像素级预测。大量实验证实了 ExACT 相对于现有 无需训练 和弱监督方法的优越性。