论文
相机鲁棒视觉语言动作策略的跨视图动作一致性
Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies
摘要
当相机移动时,即使任务、对象、语言和机器人状态不变,从固定场景相机微调的视觉-语言-动作 (VLA) 策略也可能会失败。我们仅使用场景 RGB 图像、语言和本体感觉来研究场景相机视点的鲁棒性,无需相机标签、外在参数、深度或点云输入。手腕流始终被屏蔽,以防止不受干扰的视觉快捷方式混淆对场景摄像机变化的归因。对于基于流的 VLA,我们建议对动作流速度场进行正则化,该量直接积分以生成连续的动作块。我们通过将原始 LIBERO 演示重置为相同的 MuJoCo 状态并渲染标称和扰动的场景摄像机视图来构建动作等效视图对。两个视图都受到流匹配的监督,而交叉视图损失则促使它们预测的动作流速度在相同的采样流坐标上一致。在 LIBERO-Plus 相机扰动轨道上,我们的方法达到 87.2$\pm$0.4%(3 个训练种子中每个种子 4,797 次展示),在相同配对数据上的仅流匹配训练上+7.4pp(79.8$\pm$0.8%,也是 3 个种子),比朴素混合相机 SFT +12.5pp,同时保持标称相机 ID 性能(95.0$\pm$0.8%;相同数据仅 FM:95.0$\pm$4.3%)。随机配对控制下降至 25.8%,表明增益取决于动作等效配对。在真实的机器人上,我们评估了三个桌面任务,每个任务有 10 次滚动和相机放置;在相同的单场景 RGB 推理接口下,保持相机成功率从 53.3% 提高到 74.4%。