论文

CoRe-VLA:在摄像机移动下保留 VLA 中的跨视图协调

CoRe-VLA: Preserving Cross-View Coordination in VLAs under Camera Shifts

摘要

VLA 将预训练的视觉语言表示与动作生成相结合,以实现跨不同任务的语言引导控制,成为具身智能的主流范例。然而,多项研究报告称,VLA 在摄像机移动的情况下任务成功率大幅下降,揭示了限制可靠部署的关键漏洞。为了解决这个漏洞,现有的方法从不同的角度收集同一场景的配对观察结果,以微调 VLA 或训练视觉适应模块。不幸的是,他们需要额外的数据收集和 VLA 训练成本。在本文中,我们首先识别外部相机移动下的跨视图协调故障:机器人可能过于依赖手腕视图线索,从而在失去全局视图时以错误的顺序执行子任务。受此启发,我们提出了 CoRe-VLA,这是一种即插即用框架,不需要额外的多视图数据收集,也不需要 VLA 微调,它可以与现有的 VLA 合并。它重建场景点云并从 VLA 的训练视点渲染观察结果以恢复跨视图协调。在 CoRe-VLA 中,渲染到相机 (R2C) 恢复可减少渲染引起的视觉退化,而执行轨迹条件对齐 (ETCA) 可减少机器人空闲时间并减轻异步执行期间的运动冲突。对 5 个真实机器人任务、LIBERO-100 和 LIBERO-Plus 进行的实验表明,CoRe-VLA 极大地提高了摄像机移动下主流 VLA 的任务成功率。例如,在真实机器人环境中,CoRe-VLA 将 PI0.5 在 1.6m 相机移位时的成功率从 13.3% 提高到 83.3%。