论文
从基础到应用:在实践中改进VLA模型
From Foundation to Application: Improving VLA Models in Practice
摘要
尽管 VLA 基础模型最近取得了进展,但实验室条件和实际应用之间的差异仍然阻碍了其实际实施。为了弥补这一差距,我们推出了 LingBot-VLA 2.0,它通过三个功能领域的改进改进了 LingBot-VLA。 (1)跨任务和实施例的概括。与之前的版本相比,我们改进了数据处理流程,并整理了约 60,000 小时的数据用于预训练,其中包括 50,000 小时跨越 20 种机器人配置的机器人轨迹和 10,000 小时以自我为中心的人类视频。 (2)除了双臂硬件平台外,还拓展了动作空间。特别是,我们的系统提供了头部、腰部、移动底座和灵巧手的自由度,从而使机器人能够在实际场景中处理更复杂的任务。 (3) 用于改进时间推理的预测动力学建模。具体来说,我们将未来预测制定为代理任务,并通过用于语义先验的视频表示模型和用于几何线索的深度估计模型来促进。在通才环境中进行的 GM-100 基准评估验证了这些拟议修改的有益影响。此外,受益于覆盖全身自由度的扩展预训练数据,LingBot-VLA-2.0在两个机器人平台上展示了强大的跨体长视距移动操控能力。