论文
WAM4D:通过空间寄存器词元的快速 4D 世界动作模型
WAM4D: Fast 4D World Action Model via Spatial Register Tokens
摘要
世界动作模型(WAM)最近在联合建模未来观察和可执行的机器人动作方面表现出了希望。然而,大多数现有的 WAM 仍然在 2D 视频或潜在空间中运行,其中视觉上合理的采样轨迹错过了精确操作所需的 3D 空间约束和遮挡接触几何形状。虽然几何基础模型为从视觉观察中恢复密集的 3D 结构和运动提供了强大的先验,但强制 WAM 预测密集的 4D 表示会引入昂贵的几何解码并减慢因果动作的生成。为了解决这个问题,我们提出了 WAM4D,这是一种快速 4D 世界动作模型,它使用轻量级空间寄存器标记作为训练时的未来深度读数,将预训练的几何先验传输到因果视频动作 Transformer 中,然后删除寄存器分支以进行轻量级动作推理。为了防止非因果捷径,我们进一步为 Mixture-of-Transformer (MoT) WAM 主干设计因果混合注意力,定义视频、动作和几何标记之间特定于模态的可见性。 RoboTwin 2.0 的综合实验和具有挑战性的现实世界操作任务表明,WAM4D 在保持高效推理的同时提高了空间一致性并实现了竞争动作预测。