论文
像我一样做:来自日常人类视频的灵巧操作数据
Do as I Do: Dexterous Manipulation Data from Everyday Human Videos
摘要
我们如何可扩展地生成用于机器人操作的数据,尤其是在灵巧的多指手等类似人类的平台上?最近,从人类视频中学习可能成为这个问题的答案。然而,估计手-物体交互和跨越人与机器人实施例差距的困难阻碍了采用丰富的单眼纯 RGB 人类视频作为机器人操作数据的主要来源。在这项工作中,我们提出了 DO AS I DO,一种将单眼 RGB 人类视频重建和重新定位到多指灵巧机器人手的算法。 DO AS I DO 从各种以自我为中心和外向中心的野外视频源重建手部物体交互。然后,该算法将这些手部与物体的交互估计重新定位为现实世界中可执行的一系列动作,从不同的人类视频中生成机器人完整的操作数据。总体而言,正如我们在具有基本事实的数据集和在线收集的视频剪辑数据集上的实验所示,DO AS I DO 在估计手部物体交互和从 RGB 视频中提取灵巧操作轨迹方面优于以前的最先进技术。我们的实验使我们能够为从业者收集人类数据进行操作提出一个功效手册。