论文
使用多模态进行越野测绘的基于视觉提示的推理 LLM
Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs
摘要
传统的越野自主方法依赖于单独的模型来进行地形分类、高度估计以及量化滑移或坡度条件。使用多个模型需要单独训练每个组件,具有特定于任务的数据集和 微调。在这项工作中,我们提出了一种零样本方法,利用 SAM2 进行环境分割,并使用视觉语言模型 (VLM) 来推理可驾驶区域。我们的方法包括将原始图像和每个掩模用数字标签注释的分割图像传递给 VLM。然后,VLM 会被提示识别由这些数字标签表示的哪些区域是可行驶的。与规划和控制模块相结合,这个统一的框架消除了对明确的地形特定模型的需求,而是依赖于 VLM 的固有推理能力。我们的方法超越了高分辨率分割数据集上最先进的可训练模型,并在我们的 Isaac Sim 越野环境中实现了全堆栈导航。