论文

VisTacAlign:对齐人类与机器人的视觉触觉示范

VisTacAlign: Co-Training Dexterous Policies on Tactile Human and Robot Demonstrations

模型训练合成数据

摘要

人类演示是灵巧操作的廉价数据来源,但在其上共同训练机器人策略需要缩小策略所使用的每种模式中的人类与机器人之间的差距。我们提出了 VisTacAlign,一个用于在人类和机器人演示中共同训练 3D-视觉-触觉灵巧策略的框架。手套追踪的人手运动被重定向到具有一次性指尖校正的 17-DoF 触觉机器人手。然后,从两个立体视图中删除人手,并用机器人手网格替换,该机器人手网格涂有机器人记录的像素,并且在合成图像上重新运行实时立体基础模型,因此人类点云具有与机器人点云相同的立体误差和可见性。最后,电容式触觉手套在其信号空间中与机器人的指尖传感器对齐,给出一个可解释的每手指力表示。扩散Transformer接收点云、本体感受和每个手指的触觉标记。在三个需要精确力量的现实世界任务中——乐高积木组装、采摘不同大小的草莓以及激活和举起电钻——在现有机器人数据中添加对齐的人类演示改进了仅机器人的策略,并且消融表明触觉输入和视觉对齐都是必要的。项目页面:https://vis-tac-align.github.io

VisTacAlign将人类和机器人演示对齐到统一视觉触觉表示,再训练动作策略。
图2(图注摘要):VisTacAlign将人类和机器人演示对齐到统一视觉触觉表示,再训练动作策略。