论文

UHR-Micro:诊断和减轻地球观测 VLM 中的分辨率错觉

UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 越来越多地用于分析超高分辨率 (UHR) 地球观测图像,但它们面临着广泛场景背景和微观目标之间严重的尺度不匹配问题。我们将这种现象称为“分辨率错觉”:更高的输入分辨率可以提供更多的视觉细节,但不一定转化为对任务相关微观证据的可靠感知。为了对这一挑战进行基准测试,我们引入了 UHR-Micro,该基准测试包含基于 1,212 个 UHR 图像的 11,072 条指令,旨在评估原始分辨率地球观测图像中微观证据的 VLM。 UHR-Micro 涵盖不同的目标尺度、任务系列和视觉条件,每个样本都有一个客观可验证的目标。具有代表性的高分辨率 VLM 的实验表明,尽管可以获得高分辨率输入,但在本地化和解释任务相关证据方面仍存在严重失败。进一步的分析表明,仅模型扩展是不够的,而本地化证据可以显着提高性能,表明证据访问是主要瓶颈。受这一发现的启发,我们提出了微观证据主动感知(MAP),它根据局部观察构建一个空间空间定位的证据状态,并在当前证据不足时对其进行补充。在两个主干 VLM 中,MAP 将 UHR-Micro 性能平均提高了 8.65 个百分点。 UHR-Micro 和 MAP 提供了一个用于诊断和改进地球观测 VLM 中高分辨率推理的框架。数据集和源代码发布于 https://github.com/MiliLab/UHR-Micro。