论文

以心智驾驭空间:多模态大语言模型能进行心理导航吗?

Mind over Space: Can Multimodal Large Language Models Mentally Navigate?

模型评测基准与评测资源

摘要

尽管多模态大语言模型(MLLM)已被广泛应用于具身智能体,其能力仍在很大程度上局限于基于即时观察的反应式规划,在大时空尺度的空间推理上持续失败。认知科学表明,生物智能(BI)的强项在于“心理导航”(mental navigation):从经验中策略性地构建空间表征,并在行动之前对路径进行心理模拟。为弥合AI与BI之间的差距,我们提出Video2Mental,一个用于评估MLLM心理导航能力的开创性基准。该任务要求从长自我中心(egocentric)视频构建层级化认知地图,并逐步生成基于地标的路径规划,规划准确性通过基于模拟器的物理交互加以验证。基准测试结果显示,心理导航能力并不会从标准预训练中自然涌现。前沿MLLM在零样本结构化空间表征上表现极差,且其规划准确率随时间跨度延长而急剧衰减。为克服这一问题,我们提出NavMind,一个以内显、细粒度的认知地图作为可学习中间表示来内化心理导航的推理模型。通过难度分层的渐进式监督微调范式,NavMind有效弥合了原始感知与结构化规划之间的鸿沟。实验表明,NavMind取得了卓越的心理导航能力,显著优于前沿商业模型与空间MLLM。

以心智驾驭空间:多模态大语言模型能进行心理导航吗?:论文配图
图 1:MLLM 的心理导航任务图示。我们将心理导航定义为一项要求 MLLM 理解以自我为中心的长视频(超过 5 分钟)并执行两阶段推理过程的任务。首先,该模型从视频中抽象出场景认知图,并将其输出为结构化表示(例如 JSON)。然后,它会推断出连接指定起点和目的地的基于地标的路线计划。使用跨多个指标的下游导航专家模型在模拟器中进一步评估生成的计划。