论文
以心智驾驭空间:多模态大语言模型能进行心理导航吗?
Mind over Space: Can Multimodal Large Language Models Mentally Navigate?
摘要
尽管多模态大语言模型(MLLM)已被广泛应用于具身智能体,其能力仍在很大程度上局限于基于即时观察的反应式规划,在大时空尺度的空间推理上持续失败。认知科学表明,生物智能(BI)的强项在于“心理导航”(mental navigation):从经验中策略性地构建空间表征,并在行动之前对路径进行心理模拟。为弥合AI与BI之间的差距,我们提出Video2Mental,一个用于评估MLLM心理导航能力的开创性基准。该任务要求从长自我中心(egocentric)视频构建层级化认知地图,并逐步生成基于地标的路径规划,规划准确性通过基于模拟器的物理交互加以验证。基准测试结果显示,心理导航能力并不会从标准预训练中自然涌现。前沿MLLM在零样本结构化空间表征上表现极差,且其规划准确率随时间跨度延长而急剧衰减。为克服这一问题,我们提出NavMind,一个以内显、细粒度的认知地图作为可学习中间表示来内化心理导航的推理模型。通过难度分层的渐进式监督微调范式,NavMind有效弥合了原始感知与结构化规划之间的鸿沟。实验表明,NavMind取得了卓越的心理导航能力,显著优于前沿商业模型与空间MLLM。
