论文
Co-VLA:基于共识的视觉-语言-动作模型联合训练
Co-VLA: Consensus-based Federated Training for Vision-Language-Action Models
摘要
视觉-语言-动作模型(VLA)已成为通用机器人学习的一个有前途的范例,其性能随着模型和数据集的扩展而提高。然而,扩展机器人数据收集仍然具有挑战性,因为数据自然分布在机器人、任务和位置之间,使得集中化成本高昂或不切实际。联邦学习提供了一种训练分散式机器人数据的方法,但将其应用于 VLA 需要考虑异构机器人客户端数据分布。我们提出了 Co-VLA,它将使用乘数交替方向法 (ADMM) 的共识优化应用于联合 VLA 训练。我们表明,相同的算法支持固定秩和秩自适应适配器的全模型训练和参数高效微调。 Co-VLA 这个名字反映了共识和协作:拥有不同本地机器人数据集的客户协作训练共享模型,而不共享数据。我们的实验表明,Co-VLA 在全模型训练和参数高效的微调设置中实现了与集中训练相当的性能。项目网站和我们实际实验的视频可在 https://embodiedvision.github.io/co-vla/ 获取。