论文
FineART:用于双手操作的细粒度注释机器人轨迹数据集和视觉-语言-动作模型
FineART: Fine-Grained Annotated Robotic Trajectory Dataset and Vision-Language-Action Model for Bimanual Manipulation
摘要
在现实环境中运行的机器人通常必须长期执行复杂的、多步骤的双手任务,而不是单一的、孤立的动作。当前的操作数据集很难支持这种能力:尽管单臂数据集达到数十万条轨迹,但它们通常每集仅提供一个高级指令,而现有的带有子任务标签的双手数据集仅注释其记录时间的一部分。我们提出 FineART,一个密集注释的双手操作数据集,包含 40,543 个片段(1,718 小时)和 151 个任务中的 533,913 个子任务。我们还引入了 FineART-VLA,这是一种视觉-语言-动作策略,可以预测自己的下一个子任务来指导其动作。 FineART 子任务注释的中期训练将 FineART-VLA 遵循空间指令的成功率从 32.0% 提高到 100.0%。通过分步的人工子任务指导,它还将看不见的长期任务的成功率从 16.0% 提高到 76.0%。此外,在对新机器人进行最小程度的微调后,该策略仅需要基线所需数据的十分之一,而无需进行中间训练,并将零样本推广到新硬件上未见过的任务。我们开源完整的数据集、模型权重和训练代码。