论文

模态自回归世界动作模型

Modality-Autoregressive World-Action Models

模型架构新型架构

摘要

世界动作模型 (WAM) 联合模拟未来的观察和动作,通常以 RGB 图像的形式预测未来。其他视觉模式(例如深度、预训练视觉特征和点轨迹)可以更有效地捕获几何、语义和运动特征。然而,如何在 WAM 中最好地结合这些模式仍然是一个悬而未决的问题。我们引入了 ModAR,这是第一个在预测动作之前对多种未来模式进行自回归去噪的 WAM。这使得每个预测都以先前生成的模态为条件。我们从头开始训练,系统地研究训练数据混合、预测模式和 WAM 公式如何影响性能。在我们的评估中,WAM 受益于预测点轨迹、DINO 特征和深度图,而另外预测未来 RGB 并不能提供一致的好处。我们还发现 ModAR 的顺序生成优于现有的 WAM 公式,在所有评估的数据规模上具有最高的平均成功率。我们还对相同数据上的视频模型初始化的 WAM Flex-$π$ 进行了微调; ModAR 实现了稍高的观察到的平均成功率(75% 与 72%),同时使用大约 $20\times$ 更少的训练 FLOP,并且没有预训练。在三个现实世界的双手任务中,ModAR 的表现优于基线,并通过人类视频进行了改进。