论文

GaussianDream++:用于机器人操作的高效 3D 高斯世界建模

GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation

模型训练监督微调与指令调优

摘要

视觉-语言-动作 (VLA) 策略具有先进的语言条件机器人操作,但动作模仿目标仅对度量 3D 结构和短视界物理演化提供较弱的监督。几何增强策略主要改善当前场景的基础,而预测策略通常对 RGB 或潜在空间中的未来动态进行建模,并且可能会产生大量的部署成本。 GaussianDream 证明,训练时的当前高斯重建和未来高斯预测提供了有效的 3D 监督,但其基于 VGGT/TGE 的密集前缀共同携带状态、动态和动作条件信息。我们提出了 \textbf{\methodname},一个紧凑的、策略原生的扩展,它将 \textbf{World State Tokens} 和 \textbf{World Prediction Tokens} 直接插入到 VLA 主干中。仅限训练的 \textbf{World Representation Head} 将这些标记解码为当前世界,并在共享高斯原语上耦合未来预测,而静态-动态分解保留持久结构并将残余运动集中在交互相关区域。推理时,头部、渲染器、辅助目标和 VGGT/TGE 路径被删除,只留下 20 个没有在线高斯解码或预测轨迹的世界词元。 \method 在 LIBERO 上实现了 \textbf{98.6\%},在 LIBERO-Plus 上实现了 \textbf{87.8\%},在相机和布局转换下有明显的增益。真实机器人实验进一步将再现 $π_{0.5}$ 的平均成功率从 29.2\% 提高到 52.5\%,同时保持高效的闭环控制。