论文

手环:通过无缝手臂干预改进 VLA 策略以实现灵巧操作

Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention

摘要

视觉-语言-行动(VLA)模型很容易在灵巧的操作中出现复合错误,其中高维行动空间和接触丰富的动态会放大长期的小政策偏差。虽然交互式模仿学习(IIL)可以通过人类校正数据来完善策略,但将其应用于高自由度(DoF)机器人手仍然具有挑战性,因为干预时刻人类远程操作和策略执行之间的命令不匹配,这会导致机器人手配置突然发生变化,或“手势跳跃”。我们提出了手在环(HandITL),这是一种无缝的人在环干预方法,它将人类的纠正意图与自主策略执行相结合,以避免双手灵巧操作期间的手势跳跃。与使用直接远程操作接管控制相比,HandITL 将干预抖动减少了 99.8%,并保持了稳健的干预后操作,将抓取失败减少了 87.5%,平均完成时间减少了 19.1%。我们在需要双手协调、工具使用和细粒度长视野操作的任务上验证了 HandITL。当用于收集修正数据以进行策略细化时,HandITL 生成的策略在三项长期灵巧任务中的表现比使用标准远程操作数据训练的策略平均高出 19%。