论文
LightNav-0:为通用的嵌入式导航引入 VLM 空间智能
LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
摘要
具身导航要求代理将异构目标和视觉观察转化为跨任务、环境和机器人实施例的动作。现代视觉语言模型 (VLM) 已经对视觉基础、空间推理和指向的空间先验进行了编码,但这些功能很少直接用于机器人控制。相反,现有的导航系统依赖于特定于任务或实施例的组件,将感知、推理和行动分散化,同时提供有限的概括性。在这里,我们介绍 LightNav-0,这是一种紧凑的通用嵌入式导航模型,它可以激发预训练的 VLM 的空间智能,并将其与导航对齐,而无需特定于任务的预测头。 LightNav-0 通过统一的词元接口表示不同的导航任务:双通道指向表达与任务、场景和实施例无关的空间意图,而残差矢量量化动作标记器将此意图映射到精确的、特定于实施例的轨迹。与时间感知视觉历史压缩、ER 中期训练、监督 微调 和强化学习一起,该公式支持单个模型内的指令跟踪、开放词汇对象导航和视觉跟踪。导航训练语料库涵盖 2K+ 场景和 4K+ 小时的具体导航数据。 LightNav-ER 是用于初始化 LightNav-0 的具身推理检查点,在 8 个具身推理基准测试中获得了最高的完整集平均值,而 LightNav-0 在所有 10 个公共导航模拟设置中实现了最先进的单目成功率。现实世界的评估进一步证明了跨机器人实施例、不同场景以及静态和动态目标的零样本泛化。这些结果将紧凑的 VLM 建立为通用实体导航的统一且可转移的骨干网。