论文

GraFT:通过 3D 场景图进行多模态 大语言模型 空间推理的 无需训练 框架

GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

上下文与知识知识图谱

摘要

3D 空间推理支撑着物理世界的理解和行动,但在当前的多模态 大语言模型 (MLLM) 中仍然不可靠。这些模型在精确的几何测量、自我中心和异中心观点之间的转换以及细粒度外观的基础上都表现不佳。最常见的补救措施是在大规模策划的空间推理数据集上微调模型,或为 3D 几何附加专用编码器,这通常将解决方案与昂贵的监督和特定主干结合起来。相反,我们引入了 GraFT,这是一个 无需训练 框架,它通过紧凑、易于维护的 3D 场景图 (3DSG) 提供缺失的 3D 结构。在此 3DSG 中,GraFT 提供了三种空间推理功能:(1) 通过符号工具确定几何形状,(2) 通过鸟瞰图 (BEV) 渲染进行非中心布局,以及 (3) 通过与任务相关的自我中心框架进行视觉属性基础。在 ScanQA 上,GraFT 在相同主干基线上改进了每个指标,将 CIDEr 提高了 27%。在 VSI-Bench 上,GraFT 将冻结的 MLLM 提高了高达 65%,超越了所有专有和通用开源基线以及几个著名的微调空间模型。