论文
LAWM-3D:从人类视频中学习 3D 感知潜在动作,以构建可推广的机器人世界模型
LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models
摘要
世界模型使代理能够在没有现实世界交互的情况下执行前向预测轨迹和规划。然而,它们在开放世界的具身智能中的应用仍然受到动作注释的高成本和跨平台动作空间的异质性的限制。最近,潜在动作模型(LAM)通过以自我监督的方式直接从未标记的人类视频中学习动作表示,缓解了这一瓶颈。然而,大多数现有的 LAM 依赖于单视图输入,并且主要在 2D 像素空间中运行,这就提出了一个基本问题:能否简单地将多视图视频合并到 LAM 训练中,赋予学习到的潜在动作以 3D 感知的感知?我们的研究表明答案是否定的。主要原因在于未来帧外观泄漏以及摄像机间外观差异和视点变化。为了解决这些问题,我们提出了 LAWM-3D,它引入了三个紧密耦合的关键设计:(1)用于学习 3D 感知潜在动作的多视图不变统一动作标记化方案; (2) 几何对齐约束,将中间编码器特征锚定到预训练的 3D 基础模型,从而明确提供跨视图几何对应关系; (3) 非内射 RGB-D 联合重建目标,防止从未来帧外观信息中进行捷径学习,迫使 LAM 将监督重点放在具有几何意义的运动线索上。重要的是,这些组件并不是简单地堆叠在一起,而是通过统一的动机紧密耦合在一起。基于机器人 微调 的大规模人类视频预训练的两阶段范例,大量实验表明,所提出的 3D 感知潜在动作显着提高了世界模型性能,在生成质量、物理一致性和泛化能力方面实现了 SOTA 结果。