论文

VABench:通过视觉演示、主动感知和度量控制测量体现空间智能

VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control

模型评测基准与评测资源

摘要

空间智能需要的不仅仅是描述对象位置。在不完整的观察下,模型必须识别并获取缺失的证据,在共同的空间框架中解释它,并对其采取行动。我们引入 VA-Bench 来评估完整的观察-推理-行动-修改循环。通用 MLLM 从仅 RGB 演示中学习程序上下文,主动选择相机视点,发出度量笛卡尔命令,并根据执行反馈对其进行修改。模型没有获得特权的物体姿势、预言轨迹或学习的动作头。固定的模型不可知控制器仅执行模型指定的目标。 VA-Bench 包含 14 个基本任务系列(11 个单臂和 3 个双臂)、7 个保留几何/布局变体以及一个长视野五对象合成轨道。我们在每个基本任务的相同 20 个物理验证种子上进行三次独立运行,评估 12 个主要模型条件,报告最终成功、九个轨迹级行为诊断和子任务进度。首先,在带注释的运行中,表现最好的模型在目标定位上得分为 100.0%,在空间关系上得分为 78.9%。其三轮宏观平均任务成功率仅为 53.93+/-3.17%。其次,与被动多视图观察相比,主动相机控制显着提高了任务成功率。在一项匹配比较中,成功率从 27.86% 上升到 57.50%。第三,拖延的几何转移会使任务成功率降低 30 个百分点以上。尽管取得了显着的部分进展,但没有一个模型能够完成严格的长期事件。因此,VA-Bench 测试了通用 MLLM 是否可以将视觉演示和主动获取的证据转化为成功的具体行动。