论文

什么是更好的课程:用于接触力敏感操纵的控制器形状的抓取行为

What is the Better Curriculum: Controller-Shaped Grasping Behavior for Contact Force-Sensitive Manipulation

模型训练合成数据

摘要

机器人应该如何学习操纵如此脆弱以至于亚牛顿接触力可能造成不可逆转损坏的物体?现有的视觉触觉政策学习通常将触觉感知视为额外的政策输入。然而,在直接接触力敏感操作中,在数据收集过程中,瓶颈可能会更早出现:手动夹具控制太延迟且粒度太粗,无法可靠地维持稳定抓取所需的狭窄力范围。因此,我们使用确定性 25 Hz 触觉反射控制器作为收集时间教师,通过控制器形状的抓取行为进行演示,以进行无触觉策略学习。在《变形金刚行动分块》(ACT) 中,通过反射形演示训练的策略恢复了教师的抓取轮廓,并在标称塑料杯任务中实现了 95% 的稳定抓取,大大优于视觉筛选的手动演示。相同的干预措施提高了 $\pi_{0.5}$ 上的分布稳定性,并在看不见的纸杯变体上显示出有利的探索趋势。然而,在随机外部干扰下,反射数据 $\pi_{0.5}$ 策略在 45% 的纯策略试验中仍然失败,而部署时反射仲裁器保留了所有控制权。这些结果揭示了触觉反馈在力敏感操纵中的新作用:我们没有将触觉整合到策略中,而是将其用作收集时间教师,在策略学习的演示中塑造抓取行为,而干扰拒绝仍然依赖于控制器,揭示了无触觉策略的边界。