论文
从固定相机到自由相机:免校准视图-鲁棒视觉-语言-动作模型
From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
摘要
现实世界的机器人部署很少维持训练阶段的相机设置,其中相机经常根据实际场景进行重新定位或重新安装。现有的视图鲁棒性视觉语言动作(VLA)策略只有在明确提供相机外部参数时才能容忍此类相机变化,这使得它们脆弱且难以使用,尤其是在视图鲁棒性至关重要时。我们认为,政策不应该被告知摄像头在哪里,而应该自己弄清楚。为此,我们引入了以相机为中心的 VLA (CamVLA),这是一种新的 VLA 模型,它通过预测 (i) 在本地相机框架中表达的以相机为中心的末端执行器动作,以及 (ii) 将相机与机器人底座相关联的 6-DoF 手眼矩阵,将操作控制与相机几何结构解耦。确定性几何变换将两个预测组合成机器人基架动作。这解开了我应该如何在与姿势无关的以相机为中心的动作生成中从我从相机视角几何定位中观察的位置移动。由此产生的策略是免校准、无深度和单视图,仅需要单个单目 RGB 图像作为部署时的视觉观察和任务指令。对模拟和现实世界机器人数据的评估表明,CamVLA 持续提高了不同看不见的视角的成功率。项目页面:https://alibaba-damo-academy.github.io/CamVLA/。