论文
视觉原语的动作
Action with Visual Primitives
摘要
视觉-语言-动作(VLA)模型已成为通用机器人操作的一个有前途的范例。当前架构中的常见设计将语言指令和视觉观察映射到单个前向传递中的操作。虽然概念上很简单,但这种表述将指令理解、空间场景理解和运动控制融入到一个学习目标中。因此,行动专家必须隐式地重新学习预训练 VLM 中已有的认知和感知能力,这可能会限制学习效率和泛化能力。我们引入了 AVP(带有视觉基元的动作),这是一种端到端架构,它实现了这种以视觉基元为中心的接口:VLM 推断下一阶段的目标并发出视觉基元标记,以调节流匹配动作专家,并具有源自末端执行器运动学的监督。针对一般拾放任务的真实机器人实验表明,AVP 的成功率比 pi_0.5 提高了 37.04%,并且优于其他最新方法,在数据效率、空间组合泛化和对象级传输方面具有一致的增益。