论文

MA-VLA:用于协作和组合概括的多臂视觉-语言-动作模型

MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization

智能体系统Agent 规划

摘要

多臂协作正在成为具身操控的核心能力。最近的视觉-语言-动作(VLA)模型集成了感知、语言和控制,但大多数将语言表示为单个全局指令,并且没有提供用于分配和组合特定于手臂的行为的明确机制。这种设计限制了迁移到与训练期间观察到的协作模式不同的协作模式。我们提出了 MA-VLA,一个通过原子动作分配进行多臂协作的统一框架。 MA-VLA 将协作行为分解为中级原子提示,并将它们分配给各个分支,从而实现明确的子目标规范和跨任务的组合重用。为了减少对固定执行角色的依赖,我们引入了 Arm Shuffle,这是对每个手臂的观察、状态和分配的原子提示的训练时排列。这种排列强制执行与角色无关的指令遵循,并支持重组为看不见的协调模式,我们将其称为多臂组合泛化。我们还构建了一个基准,其中训练集中不存在测试时协作模式。在模拟和现实世界的评估中,先前最先进的 VLA 在这些看不见的合作下基本上失败了,而 MA-VLA 始终取得了成功。这些结果表明,结构化的每臂原子动作分配为多臂具体系统中的可扩展泛化提供了一条实用途径。代码、模型和数据可在 https://github.com/zhangzaibin/future-robots 获取