论文

MobileWAM:通过前瞻链将世界行动模型与移动操作联系起来

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

摘要

基于视频生成主干的世界动作模型 (WAM) 是机器人学习的一个新兴方法,但仍然仅限于桌面操作。移动操纵需要在场景尺度动态中同时运动和全身操纵,但仍然以具有手工协调的动态盲视觉编码器为主。我们通过 MobileWAM 弥补了这一差距,MobileWAM 是一种 Transformer 混合架构,通过分层联合注意力将预训练视频扩散 Transformer 与轻量级动作专家融合在一起,将互联网规模的运动先验转化为全身控制。为了协调移动和操纵的异构动态,动作专家的每个前馈层都成为共享专家、运动专家和操纵专家的三专家混合体,由动作标记中的运动意图轻轻地路由。为了强化监督,我们进一步提出了预见链(CoF):中间表示顺序预测未来潜在块链,每个步骤都以其前一个步骤为条件。 CoF 与我们的解耦视频动作降噪方案自然配对。在部署时,WAM 充当纯粹的当前帧编码器;前视仅通过梯度起作用,因此在推理时前视链和视频生成被丢弃,只留下策略级成本。 MobileWAM 超越了 ManiSkill-HAB 上最先进的移动操纵策略,并针对具有强大通用性的各种任务进行了微调,以适应真正的 ARX Lift2 移动操纵器。代码即将发布。