论文

SceneBench:3D 场景视觉语言理解的分层基准

SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes

模型评测基准与评测资源

摘要

视觉语言模型擅长 2D 图像理解,但在 3D 空间推理方面仍然有限。当前基准的局限性阻碍了进展。首先,3D 数据集通常依赖于捕获几何图形的点云,但会丢弃纹理、文本和材质等丰富的视觉特征。其次,注释孤立地对待对象,而忽略了现实世界的层次结构(场景、房间、功能区域、对象组)。第三,评估任务狭隘地关注基本识别而不是多步骤空间推理。在此背景下,我们介绍了 SceneBench,它是使用高斯泼溅重建的 966 个真实感 3D 场景的基准,并使用跨越场景、房间、功能区域、对象组和单个对象的分层语义进行了密集注释。这些注释是通过人机循环管道生成的,该管道将视觉语言模型与大约 1,500 人小时的迭代细化和验证相结合,生成超过 183K 个带有文本描述和 3D 边界框的注释节点。在此表示的基础上,我们定义了三个评估任务:探测对象属性的基于存在的问题、涵盖计数、大小比较、距离和方向关系的空间智能问题,以及需要跨语义级别进行多步推理的扎根问题推理回答(QRA)三元组。最先进的视觉语言模型的实验表明,虽然模型在基本识别任务上表现良好(例如,检测准确率高达 85%),但在分层和组合推理方面的性能大幅下降(例如,计数下降到 60%),揭示了现有基准未捕获的局限性。 SceneBench 提供了一个真实的测试平台,用于开发和评估能够在逼真的 3D 环境中进行细粒度空间推理的模型。