论文

学习具有多视图潜在先验的机器人操作动作流形

Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation

摘要

本文解决了视觉-语言-动作(VLA)模型中的空间感知和操作挑战。为了解决单目输入的深度模糊性,我们利用预先训练的多视图扩散模型来合成潜在的新颖视图,并提出了一种几何引导门控 Transformer (G3T),它在 3D 几何引导下对齐多视图特征,同时自适应过滤遮挡噪声。为了提高动作学习效率,我们引入了动作流形学习(AML),它直接预测有效动作流形上的动作,绕过噪声或速度等非结构化目标的低效回归。在 LIBERO、RoboTwin 2.0 和真实机器人任务上的实验表明,我们的方法比 SOTA 基线实现了更高的成功率和鲁棒性。项目页面:https://junjxiao.github.io/Multi-view-VLA.github.io/。