论文

ST-WAM:视觉分布变化下鲁棒操纵的语义-时间世界行动模型

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

模型训练监督微调与指令调优

摘要

世界动作模型(WAM)通过联合建模机器人动作和未来视觉动态,已成为一种有前途的范例。然而,它们对像素生成未来监督的依赖可能会将与动作相关的状态转换与与任务无关的视觉内容纠缠在一起,从而限制了视觉分布变化下的鲁棒性。我们发现了训练分配幻觉,这是一种反复出现的现象,其中以视觉变化的观察为条件的未来会产生幻觉训练领域的内容,而不是忠实于当前的场景。受控的框架三联体诊断进一步表明,DINOv3 特征在视觉变化中保持更稳定,同时比 Wan-VAE 潜伏更好地保留任务状态差异。我们提出语义时间 WAM (ST-WAM),而不是纠正预测的未来,通过使用 DINOv3 作为未来预测和历史检索的共享语义表示来提高动作鲁棒性,同时保留细粒度的 VAE 动态。其双空间未来专家 (DSFE) 共同预测未来的 VAE 潜伏和 DINO 特征,而当前锚定意图检索 (CAIR) 在当前视觉语言上下文下从近期 DINO 历史中检索任务相关证据。 ST-WAM 进行端到端训练,无需额外的具体预训练或特定于任务的注释,并且在推理时不需要明确的未来生成。在 LIBERO 上达到 98.7%,在 RoboTwin 2.0 上达到 92.8%;更重要的是,与 Fast-WAM 相比,它将零样本 LIBERO-Plus 性能提高了 21.3 个百分点,并且在视觉变化下的实际成功率从 25.8% 提高到 61.5%,提高了一倍多。这些结果表明,语义时间建模有效地补充了像素生成动力学,以实现稳健的操作。