论文

DreamX-Phi 1.0:用于机器人操作的动作条件视频世界模型

DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

模型架构Transformer

摘要

我们提出了 \textbf{DreamX-Phi 1.0},这是一种用于机器人操作的动作条件视频世界模型,在给定观察到的帧、语言指令和包括末端执行器姿势和夹具状态的规定动作序列的情况下,预测未来的观察结果。然而,现实主义本身并不能保证 忠实性:看似可信的预测轨迹仍然可能会移动错误的手臂或丢失被操纵的对象。为了确保预测遵循每个手臂的命令路径,我们通过 \textbf{PRoPE 式几何编码}将每个手臂 $\mathrm{SE}(3)$ 转换注入注意力,保留手臂身份和刚性运动结构。单独的动作控制并不能完全约束场景几何形状或小型操纵对象的演变。因此,我们为场景级几何添加了一个轻量级的 \textbf{深度分支},并使用 \textbf{SAM3 mask} 和冻结的 \textbf{V-JEPA Teacher} 来保持整个抓取过程中对象的一致性。我们通过分布匹配 蒸馏 将多步生成器进一步提炼为几步学生,以实现高效部署。在撰写本文时,\model{} 在 WorldArena~2.0 挑战赛的 Track~1 上获得第一名,在 Track~2 上获得第二名。我们的模型和代码将公开。