论文

TADreamer:通过视频想象为地空双模机器人提供零镜头语言引导 3D 导航

TADreamer: Zero-Shot Language-Guided 3D Navigation for Terrestrial-Aerial Bimodal Robots via Video Imagination

摘要

地空双模机器人的语言引导导航需要选择与场景上下文和任务意图相匹配的路线和运动模式。生成的视频可以表示此类运动序列,但由于尺度模糊和与轴相关的几何失真,从中恢复度量一致的导航参考具有挑战性。我们提出了 TADreamer,这是一个零样本框架,可以将视频想象的导航基于测量的几何形状,而无需针对特定任务的训练或微调。视觉语言模型将机载观察结果和指令转化为导航提示,选择有效的生成视频,并在需要再生时提供纠正反馈。所选视频被重建为用地面或空中模式注释的 3D 航路点。两阶段校准过程使用视场约束来初始化尺度估计,然后通过将重建的点云配准到测量的几何形状来细化与轴相关的尺度、旋转和平移。校准的路径点和模式标签指导规划器结合测量的几何形状来执行机器人。真实世界的实验展示了七个室内和室外场景的导航。每轮有五个候选者,在两轮内获得所有七个场景的可用视频。在校准观测中,与 NavDreamer 相比,我们的方法将平均绝对深度误差降低了 87.7%,将平均绝对相对深度误差降低了 86.3%。