论文

CaMo:基于相机运动的视觉语言模型评估和训练

CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

模型评测模型能力评测

摘要

视觉语言模型(VLM)在空间问答基准上取得了强劲的表现,但目前尚不清楚这种收益是否反映了真正的空间智能。我们表明,现有的空间 VLM 缺乏基本的相机运动理解,而这是空间认知的关键组成部分。我们提出了空间叙事评分(SNS),这是一个评估框架,要求 VLM 生成捕获场景语义和摄像机运动的明确空间叙事,然后使用冻结代理 LLM 进行推理。在 SNS 下,尽管直接问答准确率很高,但最先进的空间 VLM 却表现出显着的性能下降。为了解决这一差距,我们引入了 CaMo,这是一种基于相机运动的 VLM,它在 SNS 评估和直接空间问答准确性方面实现了一致的性能。我们的结果强调了明确的空间叙事外化对于评估具有可转移 3D 空间理解的 VLM 的重要性。我们的代码、数据和模型可在 https://github.com/hsiangwei0903/CaMo 获取