论文
HiVLA:以视觉为中心的分层体现操纵系统
HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System
摘要
虽然端到端视觉语言动作(VLA)模型为机器人操作提供了一个有前途的范例,但 微调 它们在狭窄的控制数据上通常会损害从其基础视觉语言模型(VLM)继承的深刻推理能力。为了解决这一基本权衡问题,我们提出了 HiVLA,这是一种以视觉为中心的分层框架,它明确地将高级语义规划与底层运动控制解耦。在高层部分,VLM规划器首先执行任务分解和视觉定位以生成结构化计划,包括子任务指令和精确的目标边界框。然后,为了将该计划转化为物理动作,我们在低级部分引入了一种流程匹配扩散 Transformer (DiT) 动作专家,配备了新颖的级联交叉注意机制。这种设计依次融合了全局上下文、高分辨率的以对象为中心的裁剪和技能语义,使 DiT 能够完全专注于稳健的执行。我们的解耦架构保留了 VLM 的零样本推理,同时允许两个组件的独立改进。模拟和现实世界中的大量实验表明,HiVLA 显着优于最先进的端到端基线,特别是在长视野技能组合和杂乱场景中小物体的细粒度操作方面表现出色。