论文

Robust-WAM:在世界动作模型中桥接生成预训练和语义预见

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

模型训练监督微调与指令调优

摘要

主流世界动作模型(WAM)采用预训练的视频生成模型(VGM)进行机器人控制,在动作预测之前传输其学习的动态。这些 VGM 通常在变分自动编码器 (VAE) 潜在空间中进行训练。然而,VAE 潜在空间针对像素重建进行了优化,这会奖励精细的外观细节,并使动作预测在视觉变化下变得脆弱。最近的工作在语义潜在空间中构建了 WAM,它对外观变化更加鲁棒。然而,这些模型无法利用仅存在于 VAE 空间中的大规模 VGM 预训练。为了克服这一困境,我们提出了 Robust-WAM,这是一种用于基于视频生成的 WAM 的通用 后训练 方法,它保留了基于 VAE 的生成路径,并在动作流上添加了轻量级语义预见对齐目标。这保留了大规模 VGM 预训练,同时使外观不变的动态基础动作在照明变化和其他视觉分布外条件下保持可靠。具体来说,我们采用可学习的查询标记,通过将其输出隐藏状态与未来 真值 帧的语义预见对齐,将未来场景语义引入动作流。为了建立每个查询和它描述的未来步骤之间的时间对应关系,我们给它匹配动作标记的位置编码。分布外泛化模拟基准和真实机器人设置的实验表明,我们的 Robust-WAM 持续提高了多个 WAM 基线的成功率,而不会牺牲分布内性能。