论文

3D HAMSTER:通过 3D 轨迹引导在分层视觉语言动作模型中桥接规划和控制

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

摘要

分层视觉-语言-动作 (VLA) 模型将高层规划与低层控制分离,以提高机器人操作的泛化能力。该范式的最新工作使用视觉语言模型 (VLM) 预测的 2D 末端执行器轨迹作为下游策略的明确指导。然而,最先进的底层策略在点云上的 3D 度量空间中运行,并为它们提供缺乏深度的 2D 指导,迫使每个路径点被分配其下方的任何场景表面的深度,从而产生几何扭曲的轨迹。我们提出了 3D HAMSTER,这是一个分层框架,通过让规划器直接输出度量可靠的 3D 轨迹来缩小这一差距。我们使用专用深度编码器和密集深度重建目标来增强 VLM,以预测 3D 航路点序列,这些序列直接集成到基于点云的底层策略中。在 3D 轨迹预测、模拟和现实世界操纵方面,3D HAMSTER 始终优于专有的 VLM 和 2D 引导基线,在外观改变的变化和未见的语言、空间和视觉条件下获得最大收益。该项目页面位于 https://davian-robotics.github.io/3D_HAMSTER/。