论文

MultiView-Bench:VLM 中以世界为中心的多视图集成的诊断基准

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

模型评测基准与评测资源

摘要

最近的 VLM 基准主要评估单一或有限视角的感知,而未测试将跨视角的观察结果整合到连贯的、以世界为中心(非中心)的 3D 心智模型中的核心认知能力。我们推出了 MultiView-Bench,这是一种诊断基准,专门用于评估多视图集成以实现整体 3D 场景理解。与专注于像素级映射或相机相关导航的现有数据集不同,MultiView-Bench 需要模型将对象定位与瞬态视角解耦,并将它们置于固定的全局坐标系中。此功能是 VLM 部署用于机械零件组装等下游任务之前的先决条件。我们对前沿 VLM 的系统评估揭示了一致的故障模式:在单个图像的 2D 平面关系上表现出色,但在 3D 空间关系和跨视图聚合信息方面存在明显困难。我们进一步确定了 VLM 中的偏差,例如与非常规轴方向的斗争以及对物体色彩和纹理变化的敏感性。认识到这些局限性,我们提出了 ViewNavigator,它使用主动视点选择和证据融合,在与固定视图基线匹配的六图像上限下将四个基本模型改进了 12.3--20.0 个百分点;预算延伸收益取决于模型,GPT-5 可达 27 个百分点。