论文

OmniMapBench:对不同地图文档的以视觉为中心的推理进行基准测试

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

模型评测基准与评测资源

摘要

LVLM 的最新进展需要为复杂的、基于视觉的推理提供强大的基准。许多文档理解基准都存在一个关键限制:视觉内容通常可以简化为文本,从而在没有真正利用视觉证据的情况下实现高性能。为了解决这一限制,引入了 OmniMapBench 来促进地图文档的以视觉为中心的推理。该基准包括 9 个类别的 1,603 个地图文档中的 2,096 个手动注释的问答对。它旨在探索从感知到多步骤视觉推理的技能层次。为了量化基准属性,提出了一种简单而有效的基准级别指标:视觉依赖指数(VDI),定义为当图像被与问题无关的描述替换时的准确性下降。 OmniMapBench 表现出比既定基准更高的 VDI,这定量地验证了其对不可约视觉推理的关注。在 OmniMapBench 上对 25 个领先的 LVLM 进行了综合评估。观察到显着的性能差距,表现最好的模型仅达到 75.03% 的准确度。这一结果强调了 OmniMapBench 对当前 LVLM 带来的挑战。这项工作旨在促进以视觉为中心的推理以促进 LVLM 文档理解的进展。数据集和代码可在 https://github.com/SIGMME/OmniMapBench 上公开获取。