论文

ReVSI:重建视觉空间智能评估以准确评估 VLM 3D 推理

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

模型评测基准与评测资源

摘要

在现代视觉语言模型(VLM)设置下,当前对空间智能的评估可能是系统无效的。首先,许多基准测试从最初为传统 3D 感知设计的基于点云的 3D 注释中得出问答 (QA) 对。当此类注释被视为 真值 进行基于视频的评估时,重建和注释伪像可能会丢失视频中清晰可见的对象、错误标记对象身份或损坏依赖于几何形状的答案(例如大小),从而产生不正确或模糊的 QA 对。其次,评估通常假设全场景访问,而许多 VLM 在稀疏采样帧(例如 16-64)上运行,这使得许多问题在实际模型输入下实际上无法回答。我们通过引入 ReVSI 来提高评估有效性,ReVSI 是一种基准和协议,可确保每个 QA 对在模型的实际输入下都是可回答且正确的。为此,我们重新注释了 5 个数据集的 381 个场景中的对象和几何形状,以提高数据质量,并使用专业的 3D 注释工具通过严格的偏差缓解和人工验证重新生成所有 QA 对。我们通过提供跨多个帧预算(16/32/64/全部)的变体和细粒度对象可见性元数据,进一步增强评估的可控性,从而实现受控的诊断分析。对 ReVSI 上的通用和特定领域 VLM 的评估揭示了先前基准所掩盖的系统故障模式,从而对空间智能进行更可靠的诊断评估。