论文

SimVLA:用于移动操作的零样本模拟到真实 VLA 学习

SimVLA: Zero-Shot Sim-to-Real VLA Learning for Mobile Manipulation

模型训练应用与实践预训练合成数据机器人

摘要

大规模、多样化的数据集推动了 LLM 和 VLM 的成功。但机器人技术的 VLA 仍然受到现实世界数据收集的成本和复杂性的限制。虽然模拟提供了一种可扩展的替代方案,但其在移动操作中从模拟到真实的 VLA 学习的潜力仍未得到充分开发。我们引入了 SimVLA,这是一个端到端框架,完全基于合成模拟数据训练 VLA,无需进行移动操作的远程操作。 SimVLA 首先在两个互补的模拟衍生数据集上进行预训练:SimAction,一个涵盖 35 个不同移动操作任务的大型机器人动作数据集,通过组合原子技能生成;SimVQA,它利用特权模拟器状态来提供空间、几何和子任务级视觉语言监督。我们进一步在 SimAction 和 SimDeploy 的混合上对 SimVLA 进行后训练,SimVLA 是从不同模拟环境中的策略部署中收集的数据集。我们评估 SimVLA 的补货、倾倒和清洁等任务,并展示零次迁移到现实世界的移动操作,包括 真实的家庭环境。 SimVLA 的性能优于在 50 个域内真实世界演示中训练的策略,这表明模拟可以实现可扩展的模拟到真实的移动操作。我们进一步证明了多种互补形式的监督对于在 VLA 培训中有效利用模拟的价值。