论文

超越数据扩展:以表示为中心的续 预训练 用于视觉-语言-动作模型

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

模型训练预训练

摘要

缩放机器人数据对于构建通用视觉-语言-动作(VLA)模型至关重要,但机器人轨迹比网络规模的图像文本数据更难缩放,因为具体收集成本高昂且稀疏地覆盖物理世界。这使得表示质量成为一个中心瓶颈:在固定的机器人数据预算下,持续的 预训练 必须将有限的轨迹转化为可转移的视觉动作知识,而不仅仅是适应动作。我们提出了 VLAct,一种面向 VLA 的 VLM 主干,在特定任务 微调 之前对广泛的、异构的、多实施例的机器人数据进行训练。 VLAct 保留了广泛的 VLM 先验,并通过 VLM 先验保留、多头连续动作共同监督和部分统一的跨实施例动作布局鼓励跨实施例共享动作语义,同时允许在 微调 期间特定于任务的动作头。在模拟、现实世界和未见过的实施例传输中,VLAct 在固定的 微调 协议下持续改进下游性能。在LIBERO-Plus和RoboTwin 2.0上,VLAct超越了ABot-M0和LingBot-VLA等工业VLA系统,取得了82.6%和92.5%的成功率。在 RoboDojo 上,VLAct 在所有策略中按成功率排名第六,并且在这两个指标上均优于所有明确指定的世界行动模型 (WAM) 条目。最值得注意的是,在 RoboCasa-GR1(一种看不见的人形实施例)上,仅使用 20% 下游轨迹的 VLAct 优于全数据 GR00T-N1.6 基线。这些结果是使用完全开源数据和仅 16-GPU 训练设置获得的,表明以表示为中心的持续 预训练 可以在适度的计算预算下提供极具竞争力的性能,并且是超越数据扩展的 VLA 进展的重要独立轴。