论文

SPARC:大规模机器人演示的可靠空间注释

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

模型训练合成数据

摘要

这项工作介绍了带有可靠性校准的机器人演示的空间注释 (SPARC),这是一种风险感知框架,可以使用结构化空间注释自动标记机器人演示,并为每个注释分配可靠性分数。结构化空间注释(例如边界框、对象轨迹和操作阶段标签)使广泛的机器人应用受益,从训练视觉定位机器人策略和具体基础模型到运动规划和分层任务组合。现有的自动化管道大规模生成此类注释,但无法提供可靠的质量信号:检测器置信度对于注释正确性的校准很差,迫使人们在接受噪声标签或丢弃有用样本之间做出选择。与现有的自动化管道相比,SPARC 利用机器人任务固有的时空结构来生成可靠性信号,减少噪声标签并保留更多有用的样本。我们进一步介绍了交互感知基准(IA-Bench),这是一个基准,用于测量机器人演示中交互对象位置的模型准确性。在涵盖不同实施例和场景的 1.7k 人工注释演示中,SPARC 在定位精度方面显着优于仅检测基线,同时在高精度操作点保留了三倍以上的样本。我们的实验表明,根据我们的注释进行微调的模型在类似大小的模型中在对象视觉定位和指向基准方面实现了最先进的结果,同时在更广泛的空间推理套件上保持竞争力,而无需手动验证或注释训练数据。此外,在杂乱、视觉模糊的现实世界场景中,基于 SPARC 生成的注释训练的策略优于基线。代码、数据和模型可在直观的机器人.github.io/sparc-labeling 上获取。