论文

显而易见的隐藏含义:用于评估认知视觉推理的 RebusBench

Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning

模型评测基准与评测资源

摘要

大视觉语言模型(LVLM)在显式视觉识别方面取得了显着的熟练程度,可以有效地描述图像中直接可见的内容。然而,当视觉输入仅作为线索而不是答案时,就会出现严重的认知差距。我们发现,当前的模型难以解决解决信息未明确描述的问题所需的复杂的多步骤推理。成功解决画画谜题需要独特的认知工作流程:模型必须提取视觉和文本属性,检索语言先验知识(例如习语),并执行抽象映射以将这些元素合成为存在于像素空间之外的含义。为了评估这种神经符号能力,我们引入了 RebusBench,这是一个包含 1,164 个谜题的基准,旨在测试这种感知和知识的特定整合。我们对最先进模型(包括 Qwen、InternVL 和 LLaVA)的评估显示出严重的缺陷:性能饱和度低于 10% 的精确匹配和 20% 的语义准确性,并且模型缩放或上下文学习 (ICL) 没有观察到显着的改进。这些发现表明,虽然模型拥有必要的视觉和语言成分,但它们缺乏将它们连接起来的认知推理粘合剂。项目页面位于 https://amirkasei.com/rebusbench/。