论文
EgoMind:通过 MLLM 中的语言推理激活空间认知
EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
摘要
多模态 大语言模型 (MLLM) 越来越多地应用于空间认知任务,人们期望它们能够理解复杂的环境并与之交互。大多数现有工作通过引入 3D 先验或几何监督来改进空间推理,这提高了性能,但会产生大量的数据准备和对齐成本。相比之下,纯 2D 方法由于捕获跨帧空间关系的能力有限,常常难以进行多帧空间推理。为了解决这些限制,我们提出了 EgoMind,这是一个思想链框架,它通过角色扮演式描述实现无几何空间推理,联合构建跨帧的连贯语言场景图,以及渐进式空间分析,逐步推理特定于任务的问题。仅用 5K 自动生成的 SFT 样本和 20K RL 样本,EgoMind 在 VSI-Bench、SPAR-Bench、SITE-Bench 和 SPBench 上取得了有竞争力的结果,证明了其在增强 MLLM 空间推理能力方面的有效性,并凸显了语言推理在空间认知方面的潜力。代码和数据发布于 https://github.com/Hyggge/EgoMind。