论文

OC-VLA++:单目几何引导的交叉视图一致性,用于视点鲁棒的机器人操作

OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation

模型训练监督微调与指令调优

摘要

我们提出 OC-VLA++,这是 OC-VLA 的扩展,用于有限相机覆盖范围下的视点概括。虽然 OC-VLA 将机器人动作固定在摄像机坐标系中,以使动作监督与视觉观察保持一致,但单独的相机坐标系对齐仍然可能会过度拟合训练期间观察到的少数视点。 OC-VLA++ 通过引入几何引导的配对视图监督和显式的跨视图动作等方差目标来解决此限制。给定从几何相关的角度对同一操作场景进行配对观察,对模型进行训练,使其相机空间预测对应于相同的机器人框架动作。该目标明确监督动作预测应如何跨视点进行转换,而不是仅仅依赖于图像级增强。实验表明,在有限的相机覆盖范围下,未见视图的泛化能力得到了显着改善,而在相机位移增加的情况下,性能下降得更加缓慢。这些结果建立了跨视图动作等效性,作为对以观察为中心的动作基础的有效补充,以实现稳健的现实世界部署。