论文

GRAIL:从 3D 资产和视频先验生成人形机器人操作

GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors

模型训练合成数据

摘要

扩展人形机器人操控需要在不同的物体、全身运动和场景几何形状上进行与机器人兼容的演示,但远程操作和动作捕捉很难扩展,因为每个集合都依赖于物理设置、仪器化演员和机器人操作。我们推出了 GRAIL,这是一种在部署之前保持完全虚拟的数字生成管道:它由 3D 资产、模拟器就绪场景和视频基础模型 (VFM) 的先验组成,以合成交互,而无需重建物理环境或远程操作机器人。 GRAIL 不是重建不受约束的野外视频,而是从完全指定的 3D 配置开始,其中对象几何形状、相机参数、公制比例、环境深度和机器人比例角色在视频生成之前已知,并在重建过程中重复使用。这种特权设置为 4D 恢复提供了更好的条件,允许基于模型的对象跟踪、人体运动估计和交互感知优化来重建度量 4D 人机交互 (HOI) 轨迹,并减少深度模糊性和形态失配。我们将恢复的运动重新定位到人形机器人,并训练互补的通用任务跟踪器:用于操纵的对象感知潜在适配器和用于地形遍历的场景感知跟踪器。 GRAIL 生成超过 20,000 个序列,涵盖拾取、物体操作、坐下和地形穿越。仅使用 GRAIL 生成的数据,我们通过模拟到真实的管道训练以自我为中心的视觉策略,并将其部署在 Unitree G1 人形机器人上,在不同物体拾取方面实现了 84% 的现实世界成功率,在爬楼梯方面取得了 90% 的成功率。