论文
JEPA-WAM:通过潜在表征将生成的视觉指令接入世界动作模型
JEPA-WAM: Connecting Generated Visual Instructions to World Action Models through JEPA Latent Representations
摘要
世界动作模型(WAM)通过为预训练视频生成模型增加动作专家,展示了较强机器人操作能力。然而,仅以文本指令为条件的现有WAM,指令跟随能力仍有限。我们认为这部分源于机器人学习数据的结构失衡:丰富的视觉—动作轨迹常配以稀疏、重复的语言标注,使策略可以依靠视觉上下文和运动规律识别任务,而不必真正理解指令。为解决此问题,我们提出JEPA-WAM,为每条文本指令增加一组随机生成的视觉指令,提供多样视觉线索。具体而言,使用现成文生图模型,根据文本指令采样多张任务完成图像,无需训练生成器。这些图像的外观和布局可能与当前场景不同,但在语义上仍与指令一致,可作为视觉目标参考。为关注超越外观的任务级语义,我们用冻结的V-JEPA 2.1编码器编码这些参考,将稠密目标表征压缩成紧凑的目标Token,再通过交叉注意力为视频和动作专家提供条件。我们还构建了覆盖分布内、场景分布外和指令分布外设置的真实机器人指令跟随基准。JEPA-WAM在三种设置下的成功率分别为87.3%、74.5%和80.9%,相对π0及Fast-WAM分别至少高10.0、27.3和14.5个百分点。
