论文
通过文本表示引导推理释放多模态 大语言模型 的空间推理
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
摘要
现有的多模态 大语言模型 (MLLM) 难以进行 3D 空间推理,因为它们无法构建视频输入中描述的 3D 环境的结构化抽象。为了弥合这一差距,从异中心空间推理的认知理论中汲取灵感,我们研究了如何使 MLLM 能够对基于文本的视频空间表示进行建模和推理。具体来说,我们引入了来自自我中心视频的异中心上下文的文本表示(TRACE),这是一种提示方法,可诱导 MLLM 生成基于文本的 3D 环境表示,作为更准确的空间问题回答的中间推理轨迹。 TRACE 对元上下文、摄像机轨迹和详细的对象实体进行编码,以支持对自我中心视频的结构化空间推理。 VSI-Bench 和 OST-Bench 上的大量实验表明,TRACE 在各种 MLLM 主干、跨越不同参数尺度和训练模式的现有提示策略上取得了显着且一致的改进。我们进一步提出消融研究来验证我们的设计选择,并进行详细分析来探讨 MLLM 中 3D 空间推理的瓶颈。