论文
GaussianWAM:将三维高斯场的几何与语义蒸馏给世界动作模型
GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models
摘要
世界动作模型 (WAM) 使用视频动态作为机器人操作的表示学习信号,共同学习未来的视觉预测和动作生成。然而,它们的视频潜在特征主要针对视觉预测进行了优化,并且没有明确鼓励保留跨视图几何结构或空间局部化、与对象相关的语义。我们提出了 \textbf{GaussianWAM},一种训练时表示增强框架,通过 3D 高斯场组织几何和语义监督。给定同步多视图观察,冻结几何和视觉基础模型提供深度、相机参数和密集语义特征。 GaussianWAM 将这些异构信号绑定到共享高斯基元,并渲染空间对齐的语义、深度和覆盖目标,这些目标被提炼成 WAM 的当前观察表示。所有教师模型、高斯组件和辅助预测头在训练后都被删除,留下原始的 WAM 推理路径,无需额外的模块或前向计算。在 LIBERO-Plus 上,GaussianWAM 将 FastWAM 从 52.05\% 提高到 71.29\%,将 Cosmos Policy 从 71.52\% 提高到 77.30\%。 Direct CLIP 和 VGGT 蒸馏 已经建立了 69.37\% 的强大 FastWAM 基线,而高斯场统一进一步将其提高到 71.29\%,支持空间组织异构教师信号的优势。 GaussianWAM 还提高了标准 LIBERO 的性能,并在 RoboTwin 和现实世界的操作上显示出积极的转移趋势。这些结果表明,训练时 Gaussian 蒸馏 提供了一种实用的方法,可以将几何和语义相关的监督注入到 WAM 表示中,而无需更改其部署架构。