论文
RoboVista:评估各种机器人应用的视觉语言模型
RoboVista: Evaluating Vision Language Models for Diverse Robot Applications
摘要
机器人技术的多样化应用,例如工业和农业,需要机器人在各种实施方式、不断变化的视觉条件和复杂的规划中进行操作。视觉语言模型(VLM)为通用和可解释的机器人推理提供了有希望的基础。将 VLM 与不同的机器人应用相结合需要对机器人行为背后的各个决策组件进行模块化理解。对于主要基于远程操作的端到端数据集的传统机器人基准测试来说,捕获这种结构具有挑战性。我们提出了机器人问答 (RQA),这是一个模块化评估框架,以及 RoboVista,这是一个根据真实机器人系统、研究论文和专家注释制定的基准。 RoboVista 包含 474 个带有人类注释推理的视觉问答 (VQA) 实例,涵盖农业、工业、家庭、手术机器人、自动驾驶和开放机器人数据集的 39 种独特任务类型。 RoboVista 上的实验表明,最先进的 VLM 存在巨大差距。物理机器人实验表明 RoboVista 性能与现实世界任务执行之间存在很强的相关性。