论文

iGPC:以生成运动先验学习对象交互

iGPC: Generative Motion Priors for Object-Aware Humanoid Interaction

摘要

在非结构化环境中运行的人形机器人必须将强大的全身控制与感知周围物体并与周围物体进行物理交互的能力结合起来。虽然大规模人体运动数据为自然和多功能的人形控制提供了强大的先验,但将这些先验有效地转移到感知驱动的对象交互仍然具有挑战性。为了解决这个瓶颈,我们提出了一个框架,将最近提出的生成预训练控制器(GPC)从一般人体运动扩展到全身人形环境交互。首先,我们将 GPC 调整为以场景可供性线索和特权状态信息为条件的交互专家。这些专家在学习特定任务的接触行为时利用预先训练的人体运动,包括接触物体、抓住环境支撑以保持稳定以及推动可移动物体。其次,我们引入了感知驱动的 学生模型,它保留了预训练的 GPC 策略并使用机载感官观察从专家那里提炼出交互技能。为了弥合专家观察和感官输入之间的差距,我们提出了两个互补的训练目标,可以在蒸馏过程中有效适应预先训练的运动。值得注意的是,我们跨多个全身交互任务的实验表明,大规模生成人体运动先验为学习可部署的策略在接触丰富的现实环境中进行人形交互提供了有效的基础。

iGPC:以生成运动先验学习对象交互:论文原图
图 2:所提出的生成控制框架概述。 (一)专家学习。 G1 专用运动控制器和自回归电机构成了电机基础。运动场景监督初始化对象条件任务适配器,随后使用特权模拟观察对其进行细化。 (二)学生模型学习。深度、激光雷达和本体感受历史重建了专家的观察界面。观察、token 和动作监督训练估计器,然后进行有界输入校准和任务适配器细化。校准观测值 $\tilde{o}_{t}$ 条件 token 选择,而物理状态估计 $\hat{s}_{t}$ 绕过此校正并直接条件解码器 $D_{\psi}$。火焰表示在相应步骤中训练过的模块;雪花表示冻结的学习模块。橙色虚线箭头表示训练监督。