论文
FurnitureVLA:使用视觉-语言-动作模型学习长视野双手家具组装
FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model
摘要
目前机器人家具组装的工作主要集中在玩具秤设置或单臂操作上。我们推出 FurnitureVLA,这是第一个使用视觉-语言-动作模型 (VLA) 对真实比例的双手家具组装进行系统研究。我们将任务形式化,开发用于专家数据生成和评估的可扩展模拟管道,并构建用于单操作员双手控制的 VR 远程操作系统,以收集高质量的真实世界演示。为了解决具有多达 7 个子任务和 1550 个控制步骤的极端长视野组装问题,我们提出了一种进度增强型 VLA,在基于语义的子任务上进行了微调,联合预测动作和连续进度信号,实现自动子任务转换并减少推理过程中的复合错误。我们进一步研究对实际规模装配精度产生严重影响的感知和控制设计因素。与三种家具类型的基线相比,FurnitureVLA 将平均模拟成功率从 48% 提高到 80%,我们的设计因素研究还额外提高了 21%。我们在真实的 Kinova Gen3 平台上进行验证,在最困难的任务上仅下降了 16%。