论文

用于训练和部署基于块的 VLA 操作策略的模拟到真实集成管道

A Sim-to-Real Integration Pipeline for Training and Deployment of Chunk-Based VLA Manipulation Policies

AI 基础设施数据基础设施

摘要

视觉-语言-动作(VLA)模型已成为将多模态输入(包括语义指令、场景的视觉观察和本体感觉观察)映射到机器人动作的重要范例。大多数最先进的模型将末端执行器姿势空间中的动作预测为动作块序列。训练和评估这些模型需要大规模收集现实世界的演示,将机器人动作与相应的视觉和本体感觉观察配对。在真实硬件上收集此类数据通常依赖于人工远程操作,使得该过程成本高昂、耗时且难以扩展。我们提出了一个开源的模拟到真实的实验协议来解决这个瓶颈:模拟中生成的专家轨迹在真实的 Franka FR3 设置上开环重放,其中记录相应的真实视觉和本体感觉观察并将其转换为与 VLA 训练兼容的格式。然后,在闭环中重复使用相同的部署堆栈来评估该设置上经过训练的策略,以便数据收集和评估共享相同的硬件配置。由于每个真实记录都与生成它的模拟轨迹配对,因此该协议还可以直接测量模拟与真实差距。我们将收集到的数据集与管道源代码一起发布在这个 https URL 上。