论文

WorldBench:具有挑战性且视觉多样化的多模态推理基准

WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

模型评测基准与评测资源

摘要

在现实应用中,模型预计能够在不同的设置下可靠地执行。然而,许多现有的多模式基准扩展了任务类型,但没有捕获处理开放式视觉输入所需的视觉多样性。我们推出了 WorldBench,这是一个具有挑战性且视觉多样化的推理基准,用于评估多模态 大语言模型 (MLLM)。我们建立了跨多个领域(例如生物)的数千个视觉概念的分类法。在这种分类法的指导下,我们从搜索引擎和现有数据集中收集了大量图像,以全面代表视觉世界。通过结构化的试错,我们手动设计了前沿 MLLM 无法回答的具有挑战性的问题。在定量和人工评估方面,WorldBench 比任何现有的多样化基准实现了更高的视觉多样性。在 WorldBench 上评估 15 个 MLLM 揭示了视觉理解方面的弱点:即使是最强的模型也只能达到 64.0% 的准确率,而某些模型的表现略高于机会水平。我们希望我们的工作强调视觉多样性在建立多模式基准方面的重要性。