论文

OmniHOI:单眼人类视频中的灵巧手与物体交互

OmniHOI: Dexterous Hand-Object Interaction from Monocular Human Video

应用与实践机器人视觉感知与空间理解

摘要

人类操作的单眼视频提供了丰富的灵巧演示,但从单一视图重建手与物体的交互并将其转移到机器人手仍然很困难,限制了它们在机器人执行中的直接使用。先前的方法要么需要特定于任务的强化学习训练,从而限制了可扩展性,要么假设干净的运动捕捉轨迹,因此无法直接对视频进行操作。我们推出了 OmniHOI,这是一个管道,可将手部物体交互的 RGB 视频转换为灵巧手上的交互忠实轨迹。关键思想是使用每个阶段可用的证据来强制物理一致性:重建期间的图像证据、重定向期间的接触几何形状以及物理在环细化期间的动力学。每个阶段都直接优化相应的表示,在错误传播到下游或必须被学习策略吸收之前纠正错误。在将 150 个动作捕捉轨迹转移到 6 至 22 DoF 的五只灵巧手中的每一只中,我们取得了 39-89% 的成功率,而之前的转移最多为 31% 方法。在 60 个单眼视频剪辑上,我们取得了 53% 的成功率,而之前最佳的视频到机器人管道的成功率为 28%。它的轨迹也可以在真正的双手机器人上执行不同的任务。