论文

视觉-语言-动作模型联合微调的实证研究和开放测试平台

An Empirical Study and Open Testbed for Federated Fine-Tuning of Vision-Language-Action Models

模型评测基准与评测资源

摘要

将预训练的视觉-语言-动作 (VLA) 模型适应新的机器人、环境或任务需要在本地收集但通常被丢弃的演示。联邦学习是一种通过学习共享策略来利用这种分布式演示的有前景的方法。然而,它是否能够适应大型预训练 VLA 仍然是一个悬而未决的问题,并且缺乏预训练 VLA 的可重复基准和可重复使用的训练框架使得现有结果难以比较。在本文中,我们对 LIBERO 操纵基准的 40 个模拟任务以及两个真实机器人实验中的 6 个现实世界任务(分别在两个和三个站点收集的演示)对三种现代预训练 VLA 策略的联合微调进行了系统研究。我们的研究分析了这种设置中的关键选择,涵盖多个联合参数范围、三种聚合算法以及分布转移下的评估。基于这项研究,我们得出了一系列教训,包括联邦范围对聚合算法选择的主导地位,以及在物理机器人上匹配集中式微调的难度,其中跨站点异构性比模拟捕获更强。我们还强调了联合 VLA 学习的机会,例如能够匹配异构数据的集中式微调,在分布转移下保持至少与集中式微调一样的鲁棒性,以及个性化,每个客户端联合部分策略并将其余部分保留在本地,这有助于策略预训练薄弱但不留下可用的全局模型。我们开源了 \decentvla{},即该研究背后的模型和运行时无关的测试平台,以促进联合 VLA 学习的未来研究和公平比较。