论文

多模态大语言模型在离散符号理解中的认知错配

Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

模型评测基准与评测资源

摘要

虽然多模态大语言模型(MLLM)在解释自然场景方面取得了显着的成功,但它们处理离散符号(人类认知的基本组成部分)的能力仍然是一个关键的悬而未决的问题。与连续的视觉数据不同,数学公式、化学结构和语言字符等符号需要精确、更深入的解释。本文介绍了一个综合基准来评估顶级 MLLM 如何跨五个领域驾驭这些“离散语义空间”:语言、文化、数学、物理和化学。我们的研究发现了一个违反直觉的现象:模型经常在基本符号识别方面失败,但在复杂的推理任务中却取得了成功,这表明它们依赖于语言概率而不是真实的视觉感知。通过揭露这种“认知不匹配”,我们强调了当前人工智能能力的显着差距:真正感知和理解支撑科学发现和抽象思维的符号语言的斗争。这项工作为开发更严格、更人性化的智能系统提供了路线图。

多模态大语言模型在离散符号理解中的认知错配:论文配图
图 1:(a) 连续语义空间和离散语义空间之间的差异。 (b) 人眼的视觉机制。 (c)人脑对不同层次视觉符号的神经反应机制。