论文

GeoVista:基于视觉的主动感知,用于超高分辨率遥感图像的视觉语言理解

GeoVista: Visually Grounded Active Perception for Vision-Language Understanding of Ultra-High-Resolution Remote Sensing Images

智能体系统Agent 架构与控制循环

摘要

解释超高分辨率(UHR)遥感图像需要模型在大规模场景中搜索稀疏且微小的视觉证据。现有的遥感视觉语言模型可以使用缩放和裁剪工具检查局部区域,但大多数探索策略遵循一次性聚焦或单个顺序轨迹。这种单路径探索可能会丢失全局背景,使分散的区域未被访问,并多次重新访问或计算相同的证据。为此,我们提出了GeoVista,一种用于UHR遥感解译的规划驱动的主动感知框架。 GeoVista 没有致力于单一的缩放路径,而是首先构建全局探索计划,然后通过分支局部检查验证多个候选区域,同时维护跨区域聚合和重复数据删除的明确证据状态。为了实现这种行为,我们引入了 APE-GRO,这是一个冷启动监督轨迹语料库,它将各种 UHR 任务重新表述为具有统一的、尺度不变的空间表示的全局-区域-对象交互推理过程。我们进一步设计了用于全局观察、自适应区域检查和证据跟踪的观察-计划-跟踪机制,并将模型与基于 GRPO 的策略结合起来,使用逐步奖励进行规划、本地化和最终答案的正确性。 RSHR-Bench、XLRS-Bench 和 LRS-VQA 上的实验表明,GeoVista 实现了最先进的性能。代码和数据集可在 https://github.com/ryan6073/GeoVista 获取。