论文
ForgeVLA:无需语言注释的联合视觉-语言-动作学习
ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
摘要
视觉-语言-动作(VLA)模型为通用机器人智能带来了巨大的希望,但此类模型的扩展却因获取带注释的训练数据的高昂成本而受到严重瓶颈。幸运的是,部署在各个领域的配备视觉的机器人已经产生了丰富的视觉-动作对,可用于更有效地扩大 VLA 训练。然而,由于各种限制,这些原始数据无法集中聚合,并且还表现出严重的异质性。为了应对这些挑战,在本文中,我们提出了 ForgeVLA,这是一种联合 VLA 训练框架,可以从分布式视觉-动作对中学习 VLA 模型,而无需集中原始数据或需要手动注释。具体来说,ForgeVLA 中的每个客户端都配备了一个具体指令分类器,它将视觉-动作对映射到预定义的指令集,恢复丢失的语言模态并形成完整的视觉-语言-动作三元组。除了三元组构建之外,我们还认为视觉语言特征崩溃是一个关键挑战,在之前的联合 VLA 研究中很大程度上被忽视了。为了缓解这个问题,ForgeVLA 将客户端对比规划损失与服务器端自适应聚合策略相结合,以有效地学习任务区分表示。跨多个基准的广泛实验表明,ForgeVLA 显着优于其他基准,消融研究进一步验证了每个组件的贡献。