论文

GemNav:使用多模态 大语言模型 的离散词元视觉机器人导航

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

摘要

迄今为止,基于大型预训练模型构建的视觉导航策略都遵循一个共同的秘诀:专用的视觉编码器、定制的动作头以及对数千小时的跨实体数据集进行训练。我们询问这个食谱是否有必要。在本文中,我们介绍了 GemNav,一种视觉机器人导航策略,它仅在语言塔上使用低秩适应(LoRA)来适应冻结的多模态 大语言模型(MLLM)中短至中水平路点导航,没有辅助视觉编码器和连续回归头。航路点和分类导航信号共享由语言模型头生成的单个离散标记词汇,软解码辅助损失恢复纯交叉熵训练丢弃的度量结构。在一个 8.7 小时的开放语料库(比竞争训练集小大约三个数量级)上,该策略将零样本转移到四个物理上不同的看不见的环境,并在 20 个现实世界的试验中停止在距离目标 0.25-0.42 m 的范围内,这些试验涵盖开放停车场、障碍停车场、长户外化学场和室内仓库。对短图像历史进行调节可以改善离线指标,但不会给机器人带来任何好处,这表明一旦预训练的视觉特征到位,时间上下文添加的内容就有上限。这些结果表明,冻结 MLLM 的离散词元自适应可以为基础模型机器人导航提供数据高效、可部署的替代方案。