论文
从单目视频中保持几何形状的人机上半身运动重定向
Geometry-Preserving Human-to-Robot Upper-Body Motion Retargeting from Monocular Video
摘要
单目 RGB 视频为上半身机器人运动提供了人类演示的可访问来源,但视频驱动的人机传输仍然具有挑战性,因为身体和手部运动在不同的空间尺度上恢复,人类和机器人的运动学差异很大,并且很难在各个实施例中保留精细的远端运动。我们提出了一种保留几何形状的运动重定向框架,该框架将统一的身体手部重建与形态无关的几何传输集成在一起。逐帧身体估计、视频级观察和详细的手部证据共同约束单个可微动量人体装备 (MHR) 状态,同时在参数空间中修复瞬态手部伪影。重建的运动由臂段方向、肘部配置、相对手掌方向和双边手腕关系表示,并通过多级逆运动学和机器人特定的手部自适应在目标机器人上实现。在更广泛的系统中,Across-VAM 提供视频生成,而 Across-WAM 则执行人机运动映射。该方法在包含 1,769 个源帧的 16 个单眼视频上进行了评估,其中包括 10 个签名序列和 6 个可达抓取序列。相对于 SAM 3D Body,统一重建将手部平均重投影误差从 22.36 像素减少到 7.21 像素。所有 16 条重定向轨迹均完成了运动学模拟回放,并在实体机器人上进一步演示了代表性的手语和抓取动作。结果展示了从单眼人体视频到双臂灵巧机器人上协调上身运动的统一流程。