论文

SenseBench:大型视觉语言模型中遥感低级视觉感知和描述的基准

SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models

模型评测基准与评测资源

摘要

低水平的视觉感知支撑着可靠的遥感 (RS) 图像分析,但当前的图像质量评估 (IQA) 方法输出无法解释的标量分数,而不是表征物理驱动的遥感退化,明显偏离遥感专家的诊断需求。虽然视觉语言模型 (VLM) 通过提供基于语言的 IQA 提供了一种引人注目的替代方案,但它们的视觉先验严重偏向于地面自然图像。因此,VLM 是否能够克服这一领域差距来感知和表达 RS 伪影仍然没有得到充分研究。为了弥补这一差距,我们提出了 \textbf{SenseBench},这是第一个针对 RS 低级视觉感知和描述的专用诊断基准。在统一非参考和基于参考范式的基于物理的分层分类法的驱动下,SenseBench 拥有超过 10K 个精心策划的实例,涵盖 6 个主要类别和 22 个细粒度 RS 退化类别。具体来说,设计了两个补充协议用于评估:客观低级视觉\textit{感知}和主观诊断\textit{描述}。对 29 个最先进的 VLM 的综合评估不仅揭示了倾斜的领域先验和多重失真崩溃,还揭示了 \textit{流畅错觉} 和 \textit{感知描述反转} 效应。我们希望SenseBench提供强大的评估测试平台和高质量的诊断数据,以推动VLM在RS低层感知方面的发展。代码和数据集可在 \href{https://github.com/Zhong-Chenchen/SenseBench}{\textcolor{blue}{here}} 获取。