论文

HiWE:具有视觉关键点增强功能的分层世界知识模型,用于零样本 3D 路径规划

HiWE: Hierarchical World Knowledge Model with Visual Keypoint Enhancement for Zero-Shot 3D Path Planning

摘要

机器人演示生成需要一个系统来识别交互应该发生的位置、规划可行的运动并执行所需的接触。 HiWE 通过视觉基础和基于语言的规划之间基于点的界面连接这些决策。 PointVLM 经过指令调整,可使用点注释、分割派生样本、机器人观察和视觉问答数据的混合将任务相关对象与图像坐标关联起来。深度测量将这些预测提升为语义 3D 表示。语言规划器 3DLLM 使用此表示来指定末端执行器路径点和夹具命令,而混合抓取模块则解析局部抓取姿势。评估涵盖 14 项模拟操作任务和 4 项物理机器人任务,以及视觉训练数据、空间输入和抓取选择的消融。这里,零次执行是指没有进行特定任务演示训练的部署;视觉模型在微调期间使用现有的机器人数据。本文描述了该框架的原始基于点的表述;其与后续GeneralVLA扩展的关系在引言中有详细介绍。