论文

移动之眼:通过混合动态数据收集增强 VLA 空间泛化

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection

模型训练合成数据

摘要

视觉-语言-动作(VLA)模型在广义机器人操作方面显示出了非凡的前景。然而,它们的空间概括仍然脆弱。我们认为,仅仅增加观点数量是不够的。模型经常陷入捷径学习的陷阱,抓住虚假的相关性(例如,物体之间或相机和机器人底座之间的固定相对姿势),而不是学习真实的空间关系。在这项工作中,我们提出了一种以数据为中心的解决方案来增强 VLA 空间泛化。我们采用双臂设置,其中一只手臂执行操作,而另一只手臂充当移动环境摄像机。我们系统地评估了三种数据分布模式:固定、多固定和移动视图。我们的研究结果表明,将连续相机运动与不同静态视点相结合的混合策略可以在保持训练稳定性的同时大幅减少虚假相关性,从而获得最佳性能。我们的实验表明,这种策略可以减轻虚假相关性,使 VLA 能够泛化到看不见的相机姿势和对象配置,而在这些情况下,简单地添加更多静态视点会失败。至关重要的是,我们揭示了对捷径学习的敏感性和与空间泛化的斗争是不同架构所共有的普遍特征。因此,所有评估的模型(ACT、Diffusion 和 VLA 模型,包括 Pi0 和 Gr00t)都从我们的混合数据策略中受益匪浅。