论文
UltraVR:用于循证推理的诊断超分辨率图像-VQA 基准
UltraVR: A Diagnostic Ultra-Resolution Image-VQA Benchmark for Evidence-Grounded Reasoning
摘要
视觉语言模型 (VLM) 在视觉问答和多模态推理基准方面表现出色。然而,它们在超分辨率图像上的能力——其中关键证据是微小的、微妙的、空间遥远的或分布的——仍然不清楚。现有的评估主要报告最终答案的准确性,对模型是否获取和整合必要的视觉证据提供的了解有限。我们推出 UltraVR,这是一种针对超分辨率图像进行基于证据的视觉推理的诊断基准。 UltraVR 涵盖四个高价值场景:CCTV 监控、遥感 (RS)、全幻灯片图像 (WSI) 病理学和工业异常检测 (AD)。这些领域带来了互补的挑战:拥挤的闭路电视场景中的细粒度对象定位、RS 中的远程空间比较、WSI 中的多尺度证据导航以及重复工业布局中的细微不规则性检测。除了标准的 QA 三元组之外,每个实例还包含一个结构化的 真值 思想链,其中包含步骤级问题、中间答案和推理标签。这些标签将推理分解为证据基础、局部感知、量化、证据整合和决策推理,从而实现黑盒评分的过程级诊断。使用 UltraVR,我们评估了前沿 VLM,并表明当前模型在超分辨率推理方面仍然远不可靠。重要的是,结构化注释使我们能够定位整个视觉到决策流程中的故障:错误集中在证据基础和局部感知中,而下游推理通常在提供中间视觉事实时恢复。这些发现表明 UltraVR 作为诊断测试平台,不仅可以测量 VLM 是否正确回答,还可以测量其超分辨率推理过程的中断位置。