论文
RoboSPA:VLA 模型能否超越简单场景和短期任务?
RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
摘要
视觉-语言-动作(VLA)模型在语言条件机器人操作方面取得了可喜的进展。然而,现有的数据集和基准主要评估预定义设置下的任务完成情况,在空间和程序复杂性不断增加的情况下对模型推理的洞察力有限。我们引入了 \textbf{RoboSPA} (\textbf{Robo}t \textbf{S}patial-\textbf{P}rocedural \textbf{A}ssessment),这是一个大规模机器人操作数据集和用于诊断 VLA 模型中体现推理的基准。 \texttt{RoboSPA} 专注于细粒度空间推理和长视野程序规划两个核心维度,涵盖 10 个任务类别和 56 个基础任务。每个任务都通过五个难度级别进行实例化,产生 280 个变体,空间模糊性和程序复杂性不断增加。我们收集了跨多个实施例和不同场景的 527K 轨迹。除了二进制成功率之外,\texttt{RoboSPA} 还引入了诊断指标以进行更详细的评估。对代表性 VLA 模型的实验表明,当前的系统仍然在复杂的空间关系、精确的低级执行和内存密集型规划方面遇到困难。这些结果将 RoboSPA 确立为具有挑战性的诊断基准,用于开发更强大、更可靠和更通用的实体代理。我们的数据和代码可在 https://github.com/fanzhenxuan/RoboSPA 获取。