论文
4MT-VLM:VLM 认知图有多粗?
4MT-VLM: How Coarse Is a VLMs Cognitive Map?
摘要
移动的智能体必须从它从未见过的角度识别一个地方。我们引入了 4MT-VLM,这是一个程序生成的景观数据集,每种景观都通过五种刺激模式进行渲染,这些模式消除了外观线索,同时保持布局固定:形状和颜色、仅形状、仅颜色、没有物体的裸露地形山峰,以及将山峰置于地平线上的山谷视点。最后一种情况通常在临床上用于探测人类患者的海马功能。我们在 16 个不同的开源和闭源模型中测试了这个基准,并报告了 4AFC 性能,该指标也用于对人类参与者进行评分。我们观察到,模型从研究的角度识别出一个地点,但一旦相机移动,它就会丢失,在 135° 时,概率会低于 25%,而人类观察者的得分为 85%。 Frontier 模型(Gemini 3.8 Flash、GPT-5.6)仅正确回答了 39% 和 31% 的旋转试验,只有当干扰物移动距离超过 30 米时才恢复到 85% 和 55%。我们的基准测试表明,虽然当前的 VLM 拥有基本的认知图,但它们的空间分辨率从根本上来说仍然太粗糙,一旦视点发生变化,就无法维持对世界的稳定的 3D 理解。