论文
将双手家庭操作从 1,500 小时的演示扩展到 同策略 纠正
Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections
摘要
由于缺乏高质量的大规模人体演示数据,学习稳健的双手操作的通才策略受到了瓶颈。在这项工作中,我们发布了 1,500 小时涵盖日常家务任务的多样化双手操作演示,并使用这个综合语料库来训练 XR-2,这是一个强大的视觉-语言-动作 (VLA) 模型。通过专门构建的高吞吐量数据管道和精心设计的多阶段训练范例,XR-2 在我们的系统实验中获得了强大的操作性能,同时保持了良好的训练效率和高数据利用率。我们进一步研究了两个关键的缩放轴:改变专家演示数据的数量,以及来自实时人工干预的 DAgger 校正数据的 后训练。在这两种设置中,任务成功率在我们探测的数据范围内稳步提高,在我们当前的数据规模下表现出明显一致的扩展趋势。这些结果验证了 XR-2 的学习能力以及已发布数据集的有前景的扩展特性,我们将其开源以支持双手机器人操作学习的可重复研究。