论文
视觉-语言-动作模型:来自现实世界 UR5 平台的实验见解
Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform
摘要
该项目研究最近的视觉-语言-动作 (VLA) 模型是否可以以可重复且具有操作意义的方式从受控研究基准转移到现实世界的机器人平台,特别是 UR5e 操纵器。这项工作集成了真实机器人数据采集、数据集工程(与 RLDS 格式兼容)、微调 以及 OpenVLA 和 OpenVLA-OFT 模型的部署,并对动作表示和控制接口进行系统验证。该项目产生了几个基础资产:(i)完整的真实机器人数据采集管道,(ii)符合 RLDS 标准的数据集转换工作流程,(iii)用于 VLA 模型的初始 微调 和推理基础设施,以及(iv)基于真实机器人试验的一组结构化实验观察结果。这些元素共同建立了一个可重现的框架,用于评估模拟之外的基于学习的操纵系统。根据经验,实验揭示了有希望的离线指标与物理系统上不稳定的闭环行为之间存在一致的差距:这种差距不能仅仅归因于模型限制,它受到动作语义、坐标系约定、模态之间的时间对齐、图像预处理一致性以及数据集覆盖率和质量的强烈影响。这些观察结果引出了一个关键的解释:VLA 系统在现实环境中的成功部署较少依赖于模型容量的增量改进,而更多地依赖于整个数据模型控制管道的精确控制。该项目将基于 VLA 的机器人技术从主要以模型为中心的挑战重新构建为系统级问题;它强调了在真实机器人上运行稳健的任务执行的难度,并提供了对可靠部署所需条件的清晰、基于实验的理解。