论文

Embodied3DBench:视觉语言模型的低级体现空间智能基准测试

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models

模型评测基准与评测资源

摘要

当前的视觉语言模型 (VLM) 是否准备好理解和推理 3D 环境中复杂的具体交互?我们推出了 Embodied3DBench,这是一个以机器人为中心的基准测试,针对具体 3D 环境中的低级空间智能。为了系统地评估这些基本感知能力,该基准包括 6 个任务类别,分为两个核心组:空间结构理解(基础、空间关系预测和多视图对应)和面向交互的感知(可供性预测、抓握点预测和轨迹预测)。该基准测试涵盖 12 个子类别,包含超过 21,000 个高质量问答对。我们评估了 13 个最先进的模型,结果表明,虽然当前模型表现出相对较强的高级空间推理,例如理解对象到对象的位置关系,但它们在面向交互的感知方面仍然脆弱,突出表明严重缺乏稳健的 3D 感知交互先验。为了积极弥补我们的基准测试揭示的这种能力差距,我们进一步综合了一个包含 130 万个 QA 对的大规模训练数据集。值得注意的是,该数据集上的 微调 在低级空间智能方面产生了显着改进。最终,Embodied3DBench 通过提供系统评估框架和可扩展的数据解决方案填补了关键空白,为交互感知多模式系统的开发设定了明确的目标。