论文

超越本地化:来自全向图像的 MLLM 中透视条件空间推理的综合基准

Beyond Localization: A Comprehensive Benchmark of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 显示出很强的视觉感知,但在不断变化的视角下对空间的推理仍然有限。我们将这一挑战作为 360 度全向图像中的透视条件空间推理 (PCSR) 进行研究,其中广泛的场景覆盖减少了部分观察的模糊性,而无需消除依赖于视点的推理的需要。为了评估这种能力,我们引入了 PCSR-Bench,这是一个由来自 26 个室内环境的 2,600 张全向图像的 84,373 个 QA 对组成的诊断基准,分为三个认知组(感知、空间和高级 PCSR)下的八项任务。我们评估了 14 个代表性 MLLM,并观察到显着的感知推理差距:有限视场推理 (T7) 的准确率达到 57.59%,但相对方向 (T2)、自我中心旋转 (T4) 和开放式组合方向链 (T3) 的准确率分别下降至 13.49%、7.13% 和 0.64%。为了探究这一差距的可塑性,我们对 7B 规模的模型进行了基于强化学习的诊断研究。在受控设置下,奖励塑造将匹配的 7B 基线从 31.10% 提高到 60.06%,这表明 PCSR 表现出部分可塑性,而不是完全不可改变。尽管如此,这些收益是任务选择性的,对奖励设计敏感,并且部分依赖于评估协议。这些结果将 PCSR 定位为当前 MLLM 的关键瓶颈,并强调了目标优化下有意义但有限的恢复空间。详细信息和访问请访问 https://github.com/Caleb-ychen/PCSR-Benchmark。