论文

WeaveEarth:无需训练 UHR 遥感理解的结构化证据构建和推理

WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding

上下文与知识上下文工程

摘要

超高分辨率(UHR)遥感图像理解需要视觉语言模型(VLM)在有限的计算预算下捕获全局场景布局和稀疏但任务关键的局部细节。现有方法主要遵循两种范式。一种是被动感知,它依赖于分辨率扩展或词元压缩,因此可能会丢弃细粒度的细节。另一种是主动感知,依赖于多轮缩放和搜索,但存在高延迟、上下文碎片和错误累积的问题。我们认为,理解 UHR 的更有效途径不在于获取更多信息,而在于更好地组织。为此,我们提出了 WeaveEarth,一个 无需训练 框架,它将 UHR 理解重新表述为全球背景约束下的结构化证据构建和推理问题。具体来说,WeaveEarth 首先采用全局感知证据构建来选择紧凑、低冗余且空间互补的最小支持证据集。然后引入结构化证据推理,将局部证据、空间元数据和相关拓扑编织到统一的推理接口中,从而增强VLM执行全局局部联合推理的能力。大量实验表明,WeaveEarth 在多个 UHR 遥感基准和多个冻结的 VLM 主干上始终优于强大的基线和现有的 UHR 方法。代码可在 https://github.com/XianZhi-Ma/WeaveEarth 获取。