论文

Human-as-Humanoid:通过具有人类对齐实施例的 Ego-Exo 人类视频实现零样本人形学习

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

模型训练合成数据

摘要

跨机器人实施例的视觉-语言-动作(VLA)模型需要高质量的观察-动作监督来学习可部署的动作分布,但扩展此类机器人数据仍然很困难,特别是对于高自由度类人机器人。远程操作提供与控制器一致的监督,而人类以自我为中心的视频捕捉不同的双手操作,但不直接提供可执行的机器人动作。我们引入了 Human-as-Humanoid,这是一种人与人之间的监督框架,可实现近乎实时的以人为中心的动作生成,通过联合对齐机器人实施例、传感设置和动作标签接口,使人类演示可用于高自由度人形 VLA 训练。 Human-as-Humanoid 基于 PrimeU(一种与人体对齐的 60 自由度上半身人形机器人)构建,使用同步的自我外显视频将部署对齐的自我中心观察与外心运动恢复配对,通过分阶段逆运动学 (IK) 将恢复的人体运动重新定位为与控制器对齐的 60 自由度动作块,并通过正向运动学 (FK) 感知监督来训练 VLA 模型,以保护手腕和指尖任务空间几何。这将大规模的人类演示从视觉观察转化为可执行的观察——对目标人形机器人的动作监督。实验在运动恢复、机器人动作空间和真实机器人部署级别验证了转换链。在我们的数据收集分析中,与人形远程操作相比,Human-as-Humanoid 产生了 4.8--7.2 倍的原始演示吞吐量增益,并且在几个下游任务中,仅使用转换后的人类标签进行后训练的策略可推广到真实的机器人部署,而无需目标任务机器人演示。官方项目网站位于 https://zgc-embodyai.github.io/Human-as-Humanoid。