论文
空间交流:语言介导的跨局部视图的空间整合
Communicating about Space: Language-Mediated Spatial Integration Across Partial Views
摘要
人类通过交流部分的、依赖于视点的观察来建立共享的空间理解。我们询问多模式 大语言模型 (MLLM) 是否可以做同样的事情,通过对话调整不同的以自我为中心的观点,形成共享环境的连贯、异中心的心理模型。为了系统地研究这个问题,我们引入了 COSMIC,这是协作空间通信的基准。在此设置中,两个静态 MLLM 代理从不同的角度观察 3D 室内环境并交换自然语言消息以解决空间查询。 COSMIC 包含 899 个不同的场景和 1250 个问答对,涵盖五个任务。我们发现了一个能力层次结构,MLLM 在跨视图识别共享锚点对象方面最可靠,在关系推理方面表现较差,并且在构建全局一致的地图方面很大程度上失败,即使对于前沿模型,其表现也几乎是偶然的。此外,我们发现思维能力可以在锚点定位方面带来收益,但对于更高层次的空间交流来说却是不够的。为了将模型行为置于情境中,我们收集了 250 段人与人的对话。人类的总体准确率达到 95%,而最好的模型 Gemini-3-Pro-Thinking 达到 72%,还有很大的改进空间。此外,随着合作伙伴在共享空间理解上保持一致,人类对话变得更加精确,而 MLLM 不断探索而不收敛,这表明在整个对话过程中形成和维持强大的共享心理模型的能力有限。我们的代码和数据可在 https://github.com/ankursikarwar/Cosmic 获取。