论文

JEPA-WAM:通过潜在表征将生成的视觉指令接入世界动作模型

JEPA-WAM: Connecting Generated Visual Instructions to World Action Models through JEPA Latent Representations

摘要

世界动作模型(WAM)通过为预训练视频生成模型增加动作专家,展示了较强机器人操作能力。然而,仅以文本指令为条件的现有WAM,指令跟随能力仍有限。我们认为这部分源于机器人学习数据的结构失衡:丰富的视觉—动作轨迹常配以稀疏、重复的语言标注,使策略可以依靠视觉上下文和运动规律识别任务,而不必真正理解指令。为解决此问题,我们提出JEPA-WAM,为每条文本指令增加一组随机生成的视觉指令,提供多样视觉线索。具体而言,使用现成文生图模型,根据文本指令采样多张任务完成图像,无需训练生成器。这些图像的外观和布局可能与当前场景不同,但在语义上仍与指令一致,可作为视觉目标参考。为关注超越外观的任务级语义,我们用冻结的V-JEPA 2.1编码器编码这些参考,将稠密目标表征压缩成紧凑的目标Token,再通过交叉注意力为视频和动作专家提供条件。我们还构建了覆盖分布内、场景分布外和指令分布外设置的真实机器人指令跟随基准。JEPA-WAM在三种设置下的成功率分别为87.3%、74.5%和80.9%,相对π0及Fast-WAM分别至少高10.0、27.3和14.5个百分点。

JEPA-WAM:通过潜在表征将生成的视觉指令接入世界动作模型:论文配图
图 1:JEPA-WAM 概述。对于每个语言指令 ℓ\ell,我们构建一个视觉指令库 ℬℓ\mathcal{B}_{\ell},其中包含从指令条件文本到图像生成器采样的 KK 图像。在每个训练步骤中,一个视觉指令被冻结的 V-JEPA 2.1 和一个可学习的投影仪随机采样并编码为紧凑的表示 ZℓZ_{\ell}。这些表示将视频和动作专家与任务指令和当前观察结合起来。右图显示了训练和推理过程中使用的自注意力和交叉注意力掩模。