论文

PrimitiveVLA:学习可重复使用的运动基元以实现高效且可推广的机器人操作

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

摘要

视觉-语言-动作(VLA)模型为通用机器人策略提供了一个有前途的范例,但它们的适应性受到数据效率低下和泛化能力差的阻碍。我们认为这些瓶颈源于盛行的直接指令到控制映射,它迫使模型记住整体轨迹而不是可重用的运动模式,即基元。我们提出了 PrimitiveVLA,一个将这种范式转变为以原始为中心的拆卸和组装范式的框架。在共享多模态规范表示 (MCR) 的支持下,PrimitiveVLA 统一了两个阶段:(1) 微调 阶段分解,它使用自动化管道将演示分解为可重用原语; (2) 推理阶段组装,采用基于 VLM 的规划器和 LLM 生成的开关模块来实现稳健的闭环执行。通过将任务分解为可重用的基元,PrimitiveVLA 使 VLA 模型能够学习不变的运动模式,而不是特定于任务的轨迹。大量的实验表明,我们的框架提高了数据效率,并在未见过的和长期任务中实现了卓越的零样本泛化。