论文

SkipVLA:通过经典规划跳过 VLA 步骤以实现快速机器人操作

SkipVLA: Skipping VLA Steps with Classical Planning for Fast Robot Manipulation

智能体系统Agent 规划

摘要

视觉-语言-动作 (VLA) 模型是一类通用机器人策略,可将相机图像和语言指令直接映射到机器人动作。虽然很有希望,但这些模型在测试时仍然很慢,特别是对于需要对策略进行多次查询的长期任务。最近的努力通过提取更小的模型、重叠异步操作块或将 VLA 与快速低级策略配对来减少 VLA 延迟,但仍然为整个任务运行学习策略。与 VLA 相比,经典运动规划器可以快速找到无碰撞运动,但需要明确的目标并且对任务没有语义理解。在这项工作中,我们提出了 SkipVLA,这是一种混合策略,它将预训练的 VLA 与经典运动规划器相结合,使用规划器进行自由空间运动,并仅查询 VLA 以获得丰富的接触技能,例如抓取和放置。 SkipVLA 重用 VLA 的冻结视觉语言主干来预测每个计划运动的目标姿势,并通过使用大型 VLA 已经学到的知识来学习该预测器,而无需在系统中引入额外的演示。我们在模拟中的 13 个 LIBERO 任务和物理 6-DoF YAM 手臂上的三个拾放任务上使用三个 VLA 评估了 SkipVLA,结果表明任务完成速度提高了 2.5 倍,并且在实现相同任务成功率的同时显着降低了能耗。