论文

学习 4D 几何先验以实现推理高效的世界行动模型

Learning 4D Geometric Priors for Inference-Efficient World Action Models

摘要

世界动作模型(WAM)通过联合建模视觉未来动态和可执行动作序列,在机器人操纵方面显示出强大的潜力。然而,现有的视频动作协同训练方法主要优化面向外观的视频潜伏,这可能不足以捕获精确操作所需的随时间演变的几何形状。我们提出了 MECo-WAM,一种多专家联合训练世界动作模型,它将动作相关的 4D 几何先验注入到视频动作表示中,同时保留原始的轻量级推理图。在训练过程中,MECo-WAM 将视频和动作专家与轻量级 4D 专家结合起来,由来自冻结 VGGT 编码器的关系目标进行监督。不对称的专家可见性可防止从辅助几何体到动作生成的非因果捷径。为了将几何知识转移到部署的视频动作路径中,我们引入了衰减的 4D 读取掩模注意力,它在训练早期提供受限的当前帧几何指导,并逐步消除这种依赖性。我们进一步提出了动作感知时间几何 蒸馏,它对齐框架内的几何关系及其时间演化,同时强调与机器人动作最相关的视觉区域。部署时,所有辅助 4D 组件都会被移除。对 LIBERO (98.2%)、RoboTwin 2.0 (92.6%) 和具有挑战性的现实操作任务的实验表明,MECo-WAM 在不增加推理成本的情况下提高了操作性能。