论文
通过以自我为中心的全身人体数据预训练建立通用人形机器人操纵模型
Towards a General Humanoid Loco-Manipulation Model via Egocentric Whole-Body Human Data Pretraining
摘要
人形全身操纵发展迅速,使政策能够协调运动、姿势、双手交互和灵巧的手部动作。与此同时,以自我为中心的人类视频提供了跨物体和场景的日常交互的多样化示例,无需机器人操作即可提供可扩展的监督。然而,这些视频的现有监督对全身运动和手部物体交互协调的覆盖范围有限,而通过人形远程操作获得这种监督也成本高昂且难以规模化。因此,我们探索人类经验如何支持人形机器人操作的可扩展学习。为了支持这项研究,我们引入了 HumanVerse-500,这是一个开放世界环境中不同人类局部操纵行为的 500 小时数据集,通过轻型可穿戴系统收集,该系统将自我中心视频与身体和手部运动同步。在此数据集的基础上,我们开发了 $λ_0$,一种全身人形视觉-语言-动作策略,通过三阶段训练,首先从不同的以自我为中心的数据集中学习交互,然后使用 HumanVerse-500 协调身体和手部运动,最后使策略适应下游任务和机器人实施例。在这些阶段中,$λ_0$ 学习用于人类经验传递的共享表示空间,而特定领域的接口则处理人类和机器人状态和动作之间的差异。我们在 SIMPLE 和 4 个现实世界的机器人操作任务上评估 $λ_0$,实现了最先进的性能,并进一步分析其扩展行为、泛化和训练阶段的贡献,以了解人类数据如何支持下游全身人形控制。我们将发布我们的代码、模型和数据以支持进一步的研究。