论文

VistaBot:通过时空感知视图合成进行视图鲁棒机器人操作

VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis

摘要

最近,端到端机器人操作模型因其通用性和可扩展性而受到广泛关注。然而,在使用固定相机进行训练时,它们通常对相机视点变化的鲁棒性有限。在本文中,我们提出了 VistaBot,这是一种新颖的框架,它将前馈几何模型与视频扩散模型相结合,以实现视图稳健的闭环操作,而无需在测试时进行相机校准。我们的方法由三个关键部分组成:4D 几何估计、视图合成潜在提取和潜在动作学习。 VistaBot 集成到动作分块 (ACT) 和基于扩散 ($π_0$) 的策略中,并在模拟和现实世界任务中进行评估。我们进一步引入视图泛化分数(VGS)作为综合评估跨视图泛化的新指标。结果表明,VistaBot 比 ACT 和 $π_0$ 分别将 VGS 提高了 2.79$\times$ 和 2.63$\times$,同时还实现了高质量的新颖视图合成。我们的贡献包括几何感知综合模型、潜在行动规划器、新的基准指标以及跨不同环境的广泛验证。代码和模型将公开。