论文

Mind's Eye:多模态视觉抽象、转换和合成的基准 LLM

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在视觉语言基准方面取得了令人瞩目的进展,但其视觉认知和视觉空间推理的能力仍然知之甚少。我们介绍“Mind's Eye”,这是一个由八项视觉认知任务组成的多项选择基准,其灵感来自于经典的人类智力测试,并按照新颖的“A-R-T”分类法进行组织:抽象、关系和转换。这些任务探索流体智能的核心过程,例如模式归纳、类比关系映射和心理转换。我们评估了各种闭源和开源 MLLM,并将它们的性能与人类参与者进行比较。人类的准确率达到 80%,而表现最好的 MLLM 仍低于 50%。错误分析揭示了以下方面的失败:(i)视觉注意力分配,(ii)内部感知操纵,以及(iii)底层视觉概念的抽象能力弱。我们的研究结果表明,与人类参与者相比,当前的 MLLM 表现出有限的视觉空间推理能力,这凸显了对更加基于认知的评估框架的需求。