论文
Frontier VLM Agent准备好成为机器人多面手了吗?具身Agent竞技场的实证研究
Are Frontier VLM Agents Ready to Be Robot Generalists? An Empirical Study with the Embodied Agent Arena
摘要
前沿视觉语言模型 (VLM) 结合了场景估计、交互基础和可执行动作。了解这些能力如何支持完整的机器人任务对于评估他们作为机器人通才的准备情况至关重要。我们引入了 Embodied Agent Arena,以检查本地能力在几何、空间推理、可供性、任务规划和操作方面支持或缺乏完成任务成功的地方。该竞技场包含来自 32 个既定来源和 GeoProbe 的 1,000 个案例,GeoProbe 是我们对 Blender 渲染和真实场景图像进行几何估计的新基准。最小的Harness保留源观察和操作,同时分离度量精度、功能基础和本机目标完成。我们评估了七个 VLM,分析了 Astra 特定于任务的优势,并比较了更丰富的观察执行协议和多轮审查。纵观整个领域,Astra 的优势在精确估计和可用接触定位方面最强;完成协调的、目标导向的行动仍然是机器人通才的关键差距。