论文

GraphVerse:多模态综合可视化图推理基准 大语言模型

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

模型评测基准与评测资源

摘要

最近的多模态 大语言模型 (MLLM) 在不同的视觉语言任务中取得了显着的进展,迫切需要更具挑战性的基准。然而,对于这些模型是否能够真正对结构化视觉信息进行推理,现有的评估仍然提供有限的见解。视觉图推理 (VGR) 为这一挑战提供了一个引人注目的测试平台,要求模型在基于图的视觉输入上集成感知、结构理解和多步骤推理。然而,之前的 VGR 基准通常将任务简化为视觉感知,然后进行基于文本的推理,将评估限制为单图像设置,依赖于仅答案的指标,并且不足以代表现实的以图形为中心的场景。为了弥补这一差距,我们引入了 GraphVerse,这是一个统一的基准,可以在单图像和配对图像设置下联合评估 MLLM 中的感知、视觉推理和基于文本的图形推理。其核心是一套以图形为中心的图像编辑(GIE)策略,可以修改图形图像,同时保留其语义,将其转变为视觉推理的主动测试。我们进一步提出了 VGR-Score,这是一种过程敏感的指标,用于评估超出最终答案准确性的推理质量。大量实验揭示了当前 MLLM 在 VGR 中的几个关键局限性,同时也验证了 GIE 策略的有效性以及 GraphVerse 到更广泛的多模态推理能力的可迁移性。代码可在 https://github.com/sunyuanfu/GraphVerse 获取。