论文

机器人操作中模拟到真实推广的基础:视觉-语言-动作模型的实证研究

Grounding Sim-to-Real Generalization in Robotic Manipulation: An Empirical Study with Vision-Language-Action Models

模型评测基准与评测资源

摘要

学习机器人操纵的通用控制策略通常依赖于大规模数据集。考虑到现实世界数据收集的成本高昂,一种实用的替代方案是通过模拟生成合成数据。然而,生成的合成数据通常与现实世界的分布存在显着差距。虽然许多先前的研究提出了弥合模拟与真实差异的算法,但仍然缺乏将这些方法应用于现实世界操作任务的原则性研究,特别是它们在视觉-语言-动作(VLA)模型等通用策略上的表现。在这项研究中,我们从四个维度实证检验了模拟到真实泛化的主要决定因素:多级域随机化、真实感渲染、物理真实感建模和强化学习更新。为了支持这项研究,我们设计了一个全面的评估协议来量化操作任务的实际性能。该协议考虑了背景、照明、干扰物、物体类型和空间特征的关键变化。通过涉及超过 10,000 次现实世界试验的实验,我们得出了关于模拟到真实传输的重要见解。为了为未来的研究提供信息和推进,我们发布了机器人平台和评估协议以供公众访问,以促进独立验证,从而为机器人操纵政策建立现实和标准化的基准。