论文

跨实体四足运动的形态条件世界模型

Morphology-Conditioned World Model for Cross-Embodiment Quadrupedal Locomotion

模型训练强化学习

摘要

世界模型预示着机器人技术的范式转变,智能体一次学习其环境的物理特性,然后有效地获得行为。然而,学习到的动力学模型的核心通常是形态锁定的。在腿式运动中,在 ANYmal-D 四足动物上训练的动力学模型在 Unitree Go1 上失败,因为它过度适合一个机器人的实施例,而不是捕获机器人之间共享的运动动力学,因此即使执行器动力学或肢体长度的微小变化也会迫使从头开始重新训练。然而,如果我们将机器人独特的物理特征形式化为形态规范,则机器人系列的控制器可以通过两种方式利用该蓝图。它可以将规范提供给无模型策略,也可以将规范提供给学习动态模型并在想象中提取策略。我们主张第二条路线,并引入四足世界模型(QWM),该模型在尺度不变的物理特征上调节单个生成动力学模型,并通过物理形态编码器、自适应奖励归一化器和潜在动力学中的形态调节完全在其中训练策略。保持形态信息相同,无模型策略与训练队列上的 QWM 相匹配,但在未见过的形态上会降级,而 QWM 在这种情况下会传输零样本,没有 微调、适应或预热。据我们所知,这是第一个在四足动物家族中演示零样本跨实体迁移的世界模型。