论文

通过主动 3D 场景探索增强 MLLM 空间理解以进行多视角推理

Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning

应用与实践视觉感知与空间理解

摘要

尽管多模态 大语言模型 取得了显着的进步,但由于依赖 2D 视觉先验,它们仍然难以处理复杂的 3D 空间推理。现有方法通常通过在有限的 3D 数据集上计算昂贵的 后训练 程序或通过缺乏明确的几何理解和视点灵活性的严格工具调用机制来减轻这种限制。为了应对这些挑战,我们提出了一个 \textit{无需训练} 框架,该框架引入了基于显式 3D 重建的视觉思想链机制。所提出的流程首先使用 MLLM 引导的关键字提取和多个粒度的掩模生成从单个图像重建高保真 3D 网格。随后,该框架利用外部知识库迭代计算最佳相机外在参数并合成新颖的视图,从而模拟人类的视角拍摄。大量实验表明,所提出的方法显着增强了空间理解。具体来说,该框架在 3DSRBench 和 Rel3D 等主要基准测试中优于专用空间模型和通用 MLLM,包括 \textit{GPT-5.2} 和 \textit{Gemini-2.5-Flash}。