论文

OpenHLM:全身人形机器人操纵的经验方法

OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation

摘要

全身人形机器人控制需要协调机器人的整个运动链。然而,大多数现有系统通常将上半身和下半身解耦为单独的控制器,从而限制了这种协调并产生类似于轮式双臂平台的行为。在本文中,我们询问如何构建一个全身原生视觉语言动作(VLA)模型,将语言和像素直接映射到类人机器人的所有自由度。我们进行了一项系统的实证研究,组织为一次一个变量实验的路线图,跨越三个阶段:全身远程操作、VLA 模型设计和异构协同训练。我们的研究得出了一些有趣的发现:基于关节的全身远程操作界面优于仅部分暴露人形机器人自由度的替代方案;在静态和轮式双臂平台上预训练的 VLA 能够很好地转移到人形机器人的完整动作空间;与 HuMI(UMI 的人形模拟)的联合训练将策略扩展到新的对象和指令,而无需对这些目标进行额外的全身远程操作。遵循此路线图会产生 OpenHLM,这是一种用于全身人形机器人操纵的开源配方。在跨越人形机器人广泛垂直范围的具有挑战性的长视野任务中,OpenHLM 使用不到一半的总演示时间,优于两个最先进的人形 VLA 基线(GR00T N1.6 和 $Ψ_0$)。我们的代码、训练数据和模型检查点可在 [https://openhlm-project.github.io/] 上获取。