论文

4D-WAM:通过轨迹场将时空意识注入世界行动模型

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

摘要

世界动作模型 (WAM) 基于世界模型的最新进展,联合对视频预测和动作生成进行建模。然而,它们通常在 2D 像素空间中表示视频,从而与执行机器人动作的 3D 空间产生表示间隙。最近的 3D 方法引入了 3D 信息,但未能充分利用 3D 结构的动力学。在这项工作中,我们提出了 4D-WAM,这是一种与模型无关的训练策略,通过表示对齐将 3D 轨迹场的时空知识注入到 WAM 中。为此,我们引入了两个互补的目标:1)运动对齐,它对齐相邻帧之间的时间特征变化,并鼓励模型在训练期间建立局部 4D 意识;2)目的地对齐,它引导模型通过最小化它们类似注意力的相似性分布之间的差距来从源帧推断最终目的地。这些目标共同提供了局部运动监督和长期目标指导,使 WAM 能够学习轨迹级时空表示。跨不同基础模型的广泛分布内和分布外实验证明了该模型在空间理解、执行精度、鲁棒性、泛化性和多功能性方面的改进。