论文

Wall-OSS-0.5 技术报告

Wall-OSS-0.5 Technical Report

模型训练预训练

摘要

大规模视觉语言动作 (VLA) 预训练越来越多地被采用作为机器人策略的基础,但预训练 VLA 的证据几乎总是在特定任务 微调 之后报告。这就留下了一个没有答案的基本问题:VLA 预训练本身是否会产生可执行的机器人行为,或者它只是为下游策略学习提供更好的初始化?我们推出了 Wall-OSS-0.5,这是一种基于 3B VLM 主干构建的开源 4B VLA,并配有动作生成组件,其设计目的是让预训练的机器人能力可以在物理硬件上直接测量。该模型经过 20 多个实施例的预训练,每个时期处理超过一百万条机器人轨迹以及视觉证据关联的多模态语料库。我们采用梯度桥协同训练方法,其中三个目标发挥着独特和互补的作用:离散动作预测将强大的 VLM 原生梯度路由到主干,多模态预测保留了基础的视觉语言理解,连续流匹配充当部署时动作接口。在特定任务 微调 之前,预训练检查点实现了非平凡的零样本真实机器人行为,在 17 个任务套件上以高任务进度完成了多项任务,包括保留的可变形操作任务。在 微调 之后,相同的检查点作为更强的适应先验,在 15 个真实机器人任务上达到 60.5% 的平均任务进度,比 π_0.5 好 17.5%。多模态评估进一步证实,动作训练不会削弱扎根的视觉语言能力:该模型保留了广泛的视觉语言能力,同时加强了具体的扎根。总之,这些结果将 VLA 预训练从初始化策略重新定位为可直接测试、已经有用的机器人能力来源。