论文

通过强化微调的协作多智能体视觉-语言-动作模型

Cooperative Multi-Agent Vision-Language-Action Models via Reinforced Fine Tuning

模型训练强化学习

摘要

我们研究协作多智能体视觉-语言-动作(VLA)模型的强化学习(RL)方法。这个问题具有挑战性,因为 VLA 是在大规模单Agent数据上进行预训练的,因此缺乏机器人间协作所需的细粒度协调技能。多机器人演示上的监督微调(SFT)部分弥补了这一差距,但其性能受到演示数据的限制,无法根据自身经验进行改进。我们提出了一种用于多智能体 VLA 的三阶段强化微调 (RFT) 管道。首先,初始化感知数据收集会扫描初始配置,并仅在预训练的 VLA 反复失败时才调用人工演示,从而在降低人力成本的情况下实现初始化转换的鲁棒性。其次,离线信用过滤调整将信用分配给各个Agent,并以积极的优势对每个Agent的轨迹进行微调,而不是对整个联合部署进行微调。第三,我们发现现有的 VLA 在线 RL 对于困难的多智能体任务效果较差,我们将其归因于嘈杂的共同探索和不稳定的更新。相反,我们使用在线潜在空间微调,冻结 VLA 并在其潜在噪声空间中执行强化学习。我们在 RoboTwin、RoboFactory 中的 11 项任务中评估了具有 $π_0$ 和 $π_{0.5}$ 主干的多智能体 VLA,以及使用两个 Franka 机器人进行现实世界操作。我们的多智能体 VLA 在 RoboTwin、RoboFactory 和现实世界任务上的平均成功率分别提高了 $+23.1\%$、$+16.4\%$ 和 $+44\%$。代码可在 https://anonymous.4open.science/r/mavla_rft-2BC0/. 获取