论文
UniviewVLA:具有世界建模功能的统一多视图视觉-语言-动作模型
UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling
摘要
被遮挡的任务仍然是机器人操作的瓶颈。现有解决方案要么部署需要训练推理相机奇偶性的额外物理相机,要么依赖计算成本较高的显式 3D 重建。此外,这两种方法都依赖于标准的代理视图和手腕视图观察,而无法捕获遮挡信息和未来的场景演变。为此,我们提出了 UniviewVLA,一种具有世界建模的统一多视图视觉-语言-动作模型,它仅从标准的双摄像头观察中推断出用于动作预测的多视图场景演化。我们证明,通过利用从世界模型生成的多视图未来视图,UniviewVLA 可以揭示被遮挡的线索并模拟未来场景的演变,从而改进动作预测并消除对额外硬件或显式重建的需要。此外,为了在保持预测准确性的同时加速推理,UniviewVLA 开发了运动信息词元压缩,它将每个生成的视图从 625 个词元压缩到 16 个词元,并将每个视图的延迟从 6-7 秒减少到 0.2-0.3 秒。 UniviewVLA还提出了无需训练 Action-Entropy View Selection,它在不同的推理阶段动态识别最具动作信息的视图。大量实验表明,UniviewVLA 在 LIBERO 上达到了 95.8%,在 CALVIN ABCD 到 D 上达到了 4.60,这都是标准的无遮挡基准。在定制的以遮挡为中心的任务上,它将成功率从 40.0% 提高到 73.3%,平均真实机器人成功率提高了 33.4 个百分点,在不牺牲标准无遮挡基准的情况下,展示了更强的以遮挡为中心的性能。