论文
CSWAM:世界行动模型中分布外泛化的更好因果语义表示
CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models
摘要
FastWAM 风格的世界动作模型可以实现高效的仅动作推理,但在视觉分布变化下泛化能力较差。他们的面向重建的表示强调特定于外观的细节,限制了对未见过的场景和物体的概括。如果没有观察历史,该模型也缺乏在不熟悉的视觉条件下稳健地识别与任务相关的状态变化和运动的时间证据。为了解决这些限制,我们提出了因果语义世界操作模型 (CSWAM),它通过基于 V-JEPA 2.1 构建的因果语义专家增强了 FastWAM。 V-JEPA 提供语义状态变化和运动的基于时间的表示,较少依赖于特定于外观的细节。专家从当前和过去观察的稀疏历史中了解它们未来的演变,并通过因果关注与视频和动作流共享历史衍生的上下文。在推理时,CSWAM 根据当前视频状态和观察到的语义历史条件进行动作去噪,从而保留高效的仅动作推理。我们进行模拟和真实机器人实验来评估分布变化下的泛化能力。通过具体的预训练,CSWAM 将 RoboTwin 2.0 Clean-to-Randomized 迁移的随机成功率从 10.16% 提高到 45.18%,比 FastWAM 提高了 35.02 个百分点。在两个真实机器人任务和三个 OOD 难度级别中,CSWAM 比 FastWAM 的平均成功率提高了 42.5 个百分点,从 27.5% 提高到 70.0%。