论文

抓取器感知视觉语言动作模型

Gripper-aware Vision Language Action Models

模型训练参数高效训练

摘要

视觉语言动作模型 (VLA) 具有先进的通用机器人抓取和操作能力,使机器人能够解释视觉观察和自然语言指令以生成可执行的动作序列。然而,现有的 VLA 通常隐含地假设抓取器不变,尽管抓取策略本质上是依赖于具体实施例的。不同的夹具类型,例如平行爪和吸力,通常需要不同的交互策略来实现相同的抓取目标。此外,当前的 VLA 数据集主要依赖于平行爪抓手,限制了抓手感知学习。为了解决这一差距,我们引入了 MiGA,这是一个多抓手感知数据集,涵盖多个机器人的五种不同抓手类型,并进行了 103,000 次演示,明确捕获了共享任务目标下的策略分歧。我们进一步提出 GVLA,它将新的多抓手分词器与基于适配器的策略路由相结合。我们的新抓手编码引入了结构化嵌入信息,平衡了参数共享和策略差异化,而分层探测则确认了 VLA 有意义的抓手条件表示。在模拟和现实世界机器人中进行的密集实验表明,我们的 GVLA 在评估的设置中优于当前基线。我们的方法还改进了零样本泛化或对新物体或看不见的任务的少样本适应,并实现更有效的夹具适应。