论文

TemporalGrounding:机器人操作中的多源时间定位数据集与基准

Grounded in Time: A Multi-Source Dataset and Benchmark for Temporal Grounding in Robotic Manipulation

模型评测基准与评测资源

摘要

当仅当前观察不足以确定适当的操作时,机器人操作通常需要从过去的交互中推断与任务相关的状态。尽管在对记忆增强视觉语言动作 (VLA) 模型进行基准测试方面取得了进展,但需要依赖历史的语义推理的面向应用的任务仍然代表性不足。我们引入了 GiT(Grounded in Time),这是一个数据集和基准,用于在生物实验室、家庭和工业场景中的过去事件中进行操纵决策。它包括涵盖 18 项双手任务的真实机器人和通用操作接口 (UMI) 风格演示,以及模拟数据和涵盖 9 项任务的基于 ManiSkill 的评估套件。细粒度的子任务注释和带注释的反事实任务对,其中相似的当前观察需要根据先前事件采取不同的操作,支持策略学习和历史使用的有针对性的评估。对模拟中的代表性端到端VLA模型和选定的现实世界任务的评估揭示了历史相关操作的巨大改进空间。数据集和基准可在项目页面获取。

TemporalGrounding:机器人操作中的多源时间定位数据集与基准的原论文方法或结果图
图1:(a)双臂机器人平台的概述,配备全局相机、双臂腕部相机以及左右夹具。 (b) UMI 夹具的特写视图,包括腕式摄像头、跟踪器和夹具。