论文

超越缩放:学习超高分辨率遥感的多工具视觉推理

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

智能体系统Agent 工具调用

摘要

超高分辨率 (UHR) 遥感 (RS) 图像提供了城市规模场景的细粒度地球观测证据,但对多模态 大语言模型 (MLLM) 提出了根本性挑战:与任务相关的证据通常是稀疏的、局部的且在空间上分散在极大的视觉环境中。一个自然的解决方案是为 MLLM 配备放大工具以进行主动本地检查。然而,通过 XLRS-Bench 的试点研究,我们发现放大只是部分有效:它解决了具有本地可恢复证据的简单和中等级别的任务,但在需要全局搜索、多区域比较、路径规划或分散证据推理的困难情况下却饱和了。受这一发现的推动,我们超越了单一工具放大,并引入了 GeoMTVR,这是一个根据广域卫星图像构建的大规模地理空间多工具视觉推理数据集。 GeoMTVR 包含 13K UHR VQA 样本,具有交错的推理轨迹、多样化的视觉工具调用和返回的视觉观察结果,使模型能够学习问题分解、工具选择、区域检查、对象级视觉定位、辅助视觉推理和跨工具证据集成。除了有监督的 微调 之外,我们还提出了一种以工具注意力为中心的强化学习算法,该算法将优化重点放在关键的工具使用决策上,包括何时调用工具、选择哪个工具、在哪里应用它以及如何解释工具输出。通过将 GeoMTVR 上的 SFT 与我们的 RL 算法相结合,我们开发了 GeoLens,这是一种用于 UHR RS 的多工具视觉推理 MLLM。实验表明,GeoLens 的性能始终优于直接推理和单工具放大基线,实现了更高的准确性、更好的证据基础和更高效的工具使用轨迹。