论文

LocalNav:提炼前沿 VLM 和嵌入 RL 以实现设备上对象目标导航

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

摘要

视觉语言模型 (VLM) 已作为一种强大的工具出现在机器人领域,可以通过语言上下文实现环境感知,并成为 ObjectNav 等开放词汇任务的催化剂。然而,它们的计算足迹通常将它们限制在云执行中,从而阻碍了在资源受限的机器人上进行本地部署的低延迟推理。为了应对这一挑战,我们提出了一种 蒸馏 策略,将复杂的空间语义推理从大型前沿模型转移到轻量级的 4B 参数本地 VLM,以便在嵌入式 GPU 设备(例如 Jetson Orin)上进行边缘执行。我们首先使用 Claude Sonnet 4.6 建立了最先进的 (SotA)、基于场景图 (SG) 的管道,在 HM3D OVON 基准上实现了 39.7% 的成功率 (SR)。然后,我们证明 微调 Qwen3.5-4B 在仅 500 个前沿推理轨迹上就可以有效地实现导航功能,产生 34.5% 的 SR,缩小了与大型云模型性能的差距。最后,我们引入具有词元生成(TG)正则化的 E-RLVR,以压缩物理部署的输出序列长度,同时使代理扎根于其任务。这种下游优化将 TG 开销减少了 72.1%,延迟减少了 71.8%。与量化相结合,这种联合策略可在不显着牺牲性能的情况下将整体推理延迟累计减少 82.8%,为移动机器人上的本地低延迟 VLM 执行提供了可行的范例。