论文
将视觉-语言-动作模型中的陈述性与程序性分离
Decoupling the Declarative from the Procedural in Vision-Language-Action Models
摘要
在现实世界中部署多面手机器人代理需要可转移的技能。具体来说,经过训练以从特定于对象的演示中克隆行为的策略必须推广到该对象之外,否则数据收集要求将变得棘手。最近,预训练的十亿参数视觉语言模型 (VLM) 的 微调 最初在大规模机器人数据集上进行,然后在较少的特定场景演示上进行,已成为设计视觉语言动作 (VLA) 模型的主要范例。虽然这些策略在分布中实现了最先进的操纵性能,但它们仍然容易受到微小的空间、语义和任务变化的影响。在这项工作中,我们解决了当前模型无法将声明性(即概念和实体语义)与编码在其参数中的程序性知识(即如何做某事)分离的问题,这是零样本技能迁移到新对象的基本瓶颈。为了解决这个问题,我们提出了 w$^{2}$VLA,一种具有重构信息流的新 VLA 模型。我们的方法不是将来自 VLM 编码器的所有多模态词元馈送到大型、不透明的基于 Transformer 的动作专家,而是以组合和可解释的方式使用视觉、空间和技能信息来调制机器人状态序列。与流行的、最先进的 VLA 不同,我们展示了我们的模块化方法成功地解耦了知识表示,从而实现了健壮的行为克隆和前所未有的跨不同的、看不见的对象的零样本技能转移能力。