论文

H-VLA:统一动作空间中具有关键动作推理和运动规划的分层视觉-语言-动作模型

H-VLA: Hierarchical Vision-Language-Action Model with Key-Action Reasoning and Motion Planning in a Unified Action Space

智能体系统Agent 规划

摘要

视觉-语言-动作(VLA)模型在机器人操作方面表现出了强大的潜力,但许多现有方法仍然依赖于从语言和视觉观察到密集动作的直接映射。这种表述会削弱预训练视觉语言模型(VLM)继承的语义推理能力,该模型主要针对视觉语言理解而不是低级控制进行优化,并且在空间变化(包括对象位置、场景布局、机器人实施例和摄像机视点的变化)下变得脆弱。为了解决这些限制,我们提出了 H-VLA,这是一种分层 VLA 框架,它将高级关键动作推理与低级运动生成分离。 H-VLA 结合了用于预测关键动作作为下一个操作子目标的关键动作模型、用于根据预测的关键动作生成密集的未来动作的运动规划模型,以及用于跨数据集、实施例和视点进行一致表示的统一以相机为中心的动作空间。我们进一步采用两阶段训练策略,强调预训练期间的关键动作推理和微调期间的密集动作生成。实验表明,H-VLA在SimplerEnv上取得了很强的性能,在Google Robot视觉匹配上达到91%,在Google Robot变体聚合上达到84%,在WidowX视觉匹配上达到81%。在 Agilex 真实机器人任务中,H-VLA 在分布内、分布外位置和分布外场景/对象设置下分别比最强基线提高了 10、47 和 16 个百分点。