论文
DUET-DINO:机器人操作中潜在规划的同步跨视图世界建模
DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation
摘要
动作条件的潜在世界模型可以预测未来的视觉表示,从而实现零样本目标条件的机器人规划和控制。然而,他们对细粒度空间和旋转动作的预测对于完整的 7-DoF 末端执行器控制来说是不可靠的。为了解决这一差距,我们引入了 DUET-DINO,这是一种同步交叉视图潜在世界模型,它通过交叉视图调节从静态侧面和手腕相机观察中共同学习动作条件预测。通过利用互补的全局场景和以夹具为中心的信息,DUET-DINO 能够在整个 7-DoF 动作空间上进行潜在规划。在空间多样化的触及、方向密集的角度触及和多目标抓取和举起任务中,DUET-DINO 始终优于单视图和独立双视图基线,在触及方面取得了 92% 的成功率,在角度触及方面取得了 72.5% 的成功率,在举起任务方面取得了 60.0% 的成功率。 DUET-DINO 在 DROID 和 RoboArena 数据集上从头开始训练,并在视觉分布变化下稳健地泛化。我们进一步表明,虽然 V-JEPA 2 手腕视图预测低估了细粒度动作引起的视觉动态,但 DINOv3 预测更好地捕捉动作条件场景变化,从而导致更强大的下游规划。代码和模型检查点将开源。项目页面:https://utn-air.github.io/DUET-DINO