论文

双臂视觉-语言-动作模型中的逐臂组合泛化

Arm-wise Compositional Generalization in Dual-Arm Vision-Language-Action Models

模型评测基准与评测资源

摘要

多臂协作的泛化可以被研究为跨臂以新的方式组合熟悉的原子技能。然而,现有的评估对于哪些训练和架构选择在不同的协调要求下支持这种能力的了解有限。我们引入了 ACG-Bench,这是 Arm-wise Compositional Generalization 的基准,它为研究双臂策略中的技能重组提供了一个通用的测试平台。它包含跨 8 个任务族的 23 个任务-条件对,其中有 6 个域内条件和 17 个未见过的组合,涵盖重新排序、同步、它们的组合和跨任务组合。所有方法都会收到相同的每臂原子提示,成功需要实现任务目标,同时满足物理里程碑和指定的顺序或时间限制。使用 $π_{0.5}$ 作为通用视觉语言操作骨干模型,我们将代表性数据增强和架构策略与共享源数据和通用评估协议进行比较。我们的架构研究检查了arm-token分组、特定于技能的LoRA适配器(SkillLoRA)和arm-wise注意力(AWA),强调了技能条件参数和注意力结构的互补性。结合这些选择产生 AE-VLA,它在模拟中实现了 21.53\% 的泛化成功率,而单个 $π_{0.5}$ 的泛化成功率为 2.94\%,MA-VLA的泛化成功率为 3.06\%,两个独立控制的 $π_{0.5}$ 策略的泛化成功率为 5.53\%。在实体 SO101 机器人上,AE-VLA在五种未见条件下的平均成功率达到 39.00%,而最强基线的平均成功率为 10.00%。这些发现为设计双臂策略提供了经验指导,其泛化范围超出了固定的训练例程。

双臂视觉-语言-动作模型中的逐臂组合泛化的原论文方法或结果图
图 4:SO101 示例。行显示堆栈碗/域内、堆栈碗/重新排序、堆栈碗/同步和碗中的立方体/交叉任务。表 3 报告了所有评估试验。