论文
DRAGON:基于图表的循证视觉推理的基准
DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams
摘要
图问答 (DQA) 需要模型来解释结构化视觉表示,例如图表、地图、信息图表、电路原理图和科学图表。最近的视觉语言模型(VLM)通常在这些任务上获得很高的答案准确性,但正确的答案并不能保证模型将其推理建立在支持预测的图表区域中。相反,模型可能依赖文本相关性或数据集工件,而不识别验证答案所需的视觉证据。这种限制阻碍了图推理的可靠评估并降低了可解释性。我们介绍 DRAGON,这是一个评估图表中基于证据的视觉推理的基准。给定图表、问题和正确答案,模型必须预测与证明答案所需的视觉元素相对应的边界框。这些证据区域可能包括答案承载组件、文本标签、图例、轴、连接器和推理过程中涉及的其他支持结构。 DRAGON 数据集包含来自六个图表 QA 数据集的 11,664 个带注释的问题实例:ChartQA、Circuit-VQA、InfographicsVQA、MapIQ、MapWise 和 AI2D,以及一个包含 2,445 个实例的测试集,其中包含经过人工验证的证据注释和标准化评估框架。我们对最近的 VLM 的评估表明,即使是 Claude Opus 4.6 在 AI2D 上的视觉证据定位 IoU 也仅为 23.8%,这表明忠实的视觉视觉证据定位仍然是一个开放的挑战。 DRAGON 支持未来基于视觉证据进行预测的模型研究。