论文

MLLM真的理解空间吗?一项数学推理评估

Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation

模型评测基准与评测资源

摘要

多模态大语言模型(MLLM)在面向感知的任务上取得了强大的性能,但它们执行数学空间推理的能力(定义为解析和操作二维和三维关系的能力)仍不清楚。人类可以轻松解决教科书式的空间推理问题,准确率超过 95%,但我们发现大多数领先的 MLLM 在相同任务上甚至无法达到 60%。这一显着差距凸显了空间推理是当前模型的根本弱点。为了研究这一差距,我们提出了 MathSpatial,这是一个用于评估和改进 MLLM 空间推理的统一框架。 MathSpatial 包括三个互补的组件:(i) MathSpatial-Bench,跨三个类别和 11 个子类型的 2K 问题的基准,旨在将推理难度与感知噪声隔离; (ii) MathSpatial-Corpus,一个包含 8K 个附加问题和经过验证的解决方案的训练数据集; (iii) MathSpatial-SRT,它将推理建模为由三个原子操作(关联、约束和推断)组成的结构化轨迹。实验表明,在 MathSpatial 上微调 Qwen2.5-VL-7B 可以实现有竞争力的准确性,同时减少 25% 的标记。 MathSpatial 提供了第一个将感知与推理分离的大规模资源,从而能够精确测量和全面理解 MLLM 中的数学空间推理。

MLLM真的理解空间吗?一项数学推理评估
图1:左:在提出的 MathSpatial-Bench 上,人类取得超过 95% 的准确率,而大多数 MLLM 仍低于 60%,揭示了显著的能力差距。右:空间推理的三大核心挑战,以及我们的 MathSpatial 框架为应对这些挑战而采用的设计。