论文
PokeVLA:通过全面的世界知识指导增强袖珍视觉-语言-行动模型的能力
PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance
摘要
视觉-语言-动作(VLA)模型的最新进展为机器人操作开辟了新途径,但现有方法效率有限,且缺乏高级知识和空间意识。为了应对这些挑战,我们提出了 PokeVLA,这是一种轻量级但功能强大的实体操作基础模型,可以有效地将视觉语言理解融入到动作学习中。我们的框架引入了一个两阶段的训练范例:首先,我们在包含空间基础、可供性和具身推理任务的 240 万个样本的精选多模态数据集上预训练一个紧凑的视觉语言模型 (PokeVLM);其次,我们通过多视图目标感知语义学习、几何对齐和新颖的动作专家将与操作相关的表示注入到动作空间中。大量实验证明了 LIBERO-Plus 基准和实际部署中的最先进性能,在不同扰动下的成功率和鲁棒性方面优于同类基准。为了促进可重复性和社区进步,我们将开源我们的代码、模型权重和精选 预训练 数据集的脚本。项目页面:https://getterupper.github.io/PokeVLA