论文
GaussianDream:用于机器人操作的前馈 3D 高斯世界模型
GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation
摘要
视觉语言动作(VLA)策略通过将语义先验从预训练的视觉语言模型转移到动作生成来实现先进的语言条件机器人操作。然而,标准的动作模仿学习通常缺乏对明确的 3D 空间信息、密集的几何监督和未来环境演化的充分建模,而这些对于精确的机器人交互至关重要。为了解决这个问题,我们提出了 \textbf{GaussianDream},一个前馈 3D 高斯世界模型插件。具体来说,我们在编码器中引入了可学习的 GaussianDream 查询,使模型能够捕获当前帧 3D 空间结构和短期未来演化。在训练期间,潜在的 GaussianDream 前缀由静态重建头和未来预测头处理,以产生当前 3D 高斯场景状态和未来高斯演化状态。当前分支由 RGB 渲染和深度进行监督,而未来分支则使用未来的 RGB、深度和伪 3D 场景流信号。在推理过程中,GaussianDream 丢弃所有辅助头,仅保留学习到的前缀来生成条件动作,而不进行测试时高斯重建或未来预测。实验结果表明,GaussianDream 在多个机器人操作基准测试中实现了最先进的性能,在 LIBERO 上达到 \textbf{98.4\%},在 RoboCasa Human-50 上达到 \textbf{54.8\%},在真实机器人任务上达到 \textbf{50.0\%}。与现有的 3D 增强 VLA 方法相比,GaussianDream 具有很高的准确性,同时比基于视频的世界模型方法提供更高的推理效率。