论文
MLLM 可以超越语言进行推理吗? VisReason:以视觉为中心的推理的综合基准
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
摘要
最近的多模态 大语言模型 (MLLM) 在视觉推理基准上取得了强劲的性能,但目前尚不清楚这种性能在多大程度上反映了直接基于视觉证据的推理。我们推出 VisReason,这是在感知和推理紧密耦合的日常场景中以视觉为中心的推理的基准。 VisReason 包含 10 个类别的 1,505 个问题,涵盖感知、结构和概念推理。我们的评估表明,VisReason 提出了与现有基准完全不同的挑战,暴露了人类和当前 MLLM 之间的巨大差距,并揭示了测试时推理策略的有限好处。 VisReason 提供了一种集中诊断,用于评估语言之外的以视觉为中心的推理。