论文
VISTA:针对 VLA 训练的 UMI 数据的基于视觉和物理验证的改编
VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training
摘要
通用操纵接口 (UMI) 无需特定于硬件的远程操作即可实现可扩展的现实世界机器人数据收集,但利用 UMI 数据训练大规模视觉语言动作 (VLA) 模型仍然具有根本性的挑战。我们发现了两个关键的不匹配之处:手腕上的鱼眼视图,具有严重的径向扭曲和局部以抓手为中心的视角,对于预训练的 VLM 来说是不分布的;人类收集的轨迹经常违反运动学限制、引发碰撞或超出控制器带宽,从而教导 VLA 策略采取物理上不可行的操作。为了应对这些挑战,我们提出了 VISTA,这是一个通过三个协同组件弥补这一双重差距的框架。 (i)~UMI-VQA,第一个针对腕式鱼眼观测量身定制的大规模 VQA 数据集,通过辅助视觉语言监督将 VLM 表示与扭曲的视觉状态对齐。 (ii)~系统的物理验证管道在进入训练之前执行数据完整性预检查,并对每个有效轨迹的轨迹连续性、自碰撞风险和执行保真度进行评分。 (iii)〜两阶段协同训练配方共同学习基于 UMI-VQA 的视觉语言和对经过验证的轨迹的动作预测。我们的实验凭经验表明,合并 UMI-VQA 可以持续改善下游策略性能,并且物理验证分数可以强烈预测部署成功。在各种模拟和现实世界的操作任务中,VISTA 显着优于强基线,包括 $π_{0.5}$、LingBot-VLA 和 Wall-X。我们为社区发布了物理验证管道、UMI-VQA、经过验证的轨迹数据和预训练模型。