论文

EmbodiedMidtrain:通过中期训练弥合视觉语言模型和视觉语言动作模型之间的差距

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

模型训练预训练

摘要

视觉语言动作模型 (VLA) 继承了视觉语言模型 (VLM) 的视觉和语言功能,但大多数 VLA 是从现成的 VLM 构建的,不适合具体领域,限制了其下游性能。在这项工作中,我们提出 EmbodiedMidtrain 来弥合 VLM 和 VLA 之间的差距。我们首先描述了它们之间的数据分布差距,表明 VLA 数据占据的紧凑区域在很大程度上与更广泛的 VLM 分布分开,而 VLM 数据源之间和内部的对齐程度差异很大。然后,我们构建一个中期训练数据引擎,利用轻量级可学习邻近估计器从大型 VLM 池中选择与 VLA 最一致的候选者,并在下游 VLA 微调 之前在此策划的混合物上对 VLM 进行中期训练。对三个机器人操作基准的实验表明,中间训练持续提高了不同 VLM 主干的性能,取得了与专家 VLA 和使用更大模型规模和训练预算训练的现成 VLM 相媲美的结果。进一步的分析表明,训练中期为 VLA 微调 提供了更强的初始化,从最早的步骤中获得收益,并在整个训练过程中扩大收益。此外,数据引擎捕获数据集级和样本级对齐信号,有利于空间推理而不是以文本为中心的任务,同时保留 VLM 数据的多样性。我们将发布所有代码、数据和模型以供未来研究。