论文
多模态语言模型无法发现空间不一致
Multimodal Language Models Cannot Spot Spatial Inconsistencies
摘要
空间一致性是视觉世界的基本属性,也是旨在理解物理现实的模型的关键要求。尽管最近取得了进展,但多模态 大语言模型 (MLLM) 常常难以跨多个视图推理 3D 几何。我们引入了一项更具挑战性的任务,而不是要求模型描述场景属性:给定同一场景的两个视图,识别违反 3D 运动一致性的对象。我们提出了一种简单且可扩展的方法,用于从多视图场景生成逼真的、空间不一致的图像对,从而能够系统地评估这种能力。我们的结果表明,最先进的 MLLM 的表现明显低于人类观察者,并且在不同场景属性之间表现出很大的可变性,揭示了对 3D 结构的脆弱和不完整的理解。我们希望我们的研究结果强调需要对物理世界有更深入理解的方法。