论文

先学会移动,再学会做:与任务无关的 VLA 预训练

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

模型训练预训练

摘要

视觉-语言-动作(VLA)模型从根本上受到缺乏专家演示的瓶颈——观察、指令和动作的三元组,大规模收集的成本很高。我们认为,这一瓶颈源于两个不同学习目标的合并:获得身体能力(如何移动)和获得语义对齐(做什么)。至关重要的是,只有后者需要语言监督。基于这种分解假设,我们提出了与任务无关的预训练(TAP),这是一个两阶段框架,首先通过自我监督的逆动力学目标,从廉价的、未标记的交互数据(包括丢弃的任务外轨迹和自主机器人游戏)中学习可转移的运动先验。然后,轻量级的第二阶段使用最少的专家数据将这些先验以语言为基础。在 SIMPLER 基准上,TAP 匹配在超过 100 万条专家轨迹上训练的模型,同时使用数量级较少的标记数据,与标准行为克隆相比,绝对增益提高了 10%。在现实世界的 WidowX 平台上,TAP 在摄像头扰动下保持了 25% 的成功率,而互联网规模的基线下降到 0%,这表明与任务无关的预训练可以产生强大的、可转移的物理表示,并为 Embodied AI 提供可扩展的前进道路。