论文
多模态大语言模型在离散符号理解中的认知错配
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
摘要
虽然多模态大语言模型(MLLM)在解释自然场景方面取得了显着的成功,但它们处理离散符号(人类认知的基本组成部分)的能力仍然是一个关键的悬而未决的问题。与连续的视觉数据不同,数学公式、化学结构和语言字符等符号需要精确、更深入的解释。本文介绍了一个综合基准来评估顶级 MLLM 如何跨五个领域驾驭这些“离散语义空间”:语言、文化、数学、物理和化学。我们的研究发现了一个违反直觉的现象:模型经常在基本符号识别方面失败,但在复杂的推理任务中却取得了成功,这表明它们依赖于语言概率而不是真实的视觉感知。通过揭露这种“认知不匹配”,我们强调了当前人工智能能力的显着差距:真正感知和理解支撑科学发现和抽象思维的符号语言的斗争。这项工作为开发更严格、更人性化的智能系统提供了路线图。
