论文

TANGO:利用全身视觉-语言-动作模型在杂乱环境中进行人形导航

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

摘要

我们研究使用人形机器人在杂乱的室内环境中导航的问题。与将导航建模为 2D 路径规划问题的传统方法不同,杂乱环境中的人形遍历需要连续的几何感知全身适应,包括协调手臂放置、躯干调整和步态调制,以便在复杂的 3D 空间中进行无碰撞运动。我们推出 TANGO,这是第一个全身视觉语言导航框架,用于在杂乱环境中进行语言调节的人形遍历。给定自然语言指令和以自我为中心的 RGB 观察,TANGO 可以直接预测下游全身控制的 29-DoF 关节空间动作。我们完全在模拟中训练 TANGO,通过全局路径规划、运动学全身运动生成、障碍物感知运动编辑和基于 RL 的跟踪来综合各种无碰撞遍历行为。该管道为学习语言条件的全身策略提供动态可行的动作监督。在广泛的模拟实验中,TANGO 在视觉语言导航方面展示了最先进的性能,同时在导航需要障碍物协商的具有挑战性的场景中超越了强大的模块化基线。最后,我们在 Unitree G1 人形机器人上部署 TANGO 零样本,并在杂乱的现实世界场景中观察鲁棒的语言引导遍历,而无需对任何现实世界导航数据进行训练。