论文
Embodied-Navigator:指向、思考、记忆和对齐以实现高效导航
Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
摘要
尽管大型视觉语言模型 (VLM) 具有显着先进的具身导航,但它们的直接部署仍然具有挑战性,因为现有方法经常迫使 VLM 进入不自然的动作空间,这些空间与其 2D 预训练 先验不一致,再加上严格的推理计划和低效的内存管理。为了克服这些限制,我们提出了 TAMP-Nav,一个用于高效具身导航的统一框架。首先,我们引入像素到 3D 动作公式(点),将导航重新公式化为 2D 视觉提示。具体来说,VLM 仅选择 2D 像素,然后将其投影到底层 SLAM 控制器的 3D 坐标中。这种设计自然地将具身执行与 VLM 固有的 2D 视觉功能结合起来。其次,我们提出了一种集成的选择性推理和锚定轨迹记忆机制(Think and Memorize),动态触发思维链并仅在关键节点保留高保真记忆,将冗余轨迹压缩为轻量级时空指标,从而保留关键历史信息并增强时空感知。最后,我们通过组相对策略优化(GRPO)设计了一个高效的两级对齐范式(Align)。通过将全局结果奖励与细粒度过程奖励叠加,这种密集监督将智能体的认知规划与物理环境反馈紧密结合,赋予模型自适应推理能力。实验表明,TAMP-Nav 实现了最先进的性能(例如,R2R-CE 上的 SR 为 66.2%),并且具有高运行时间和样本效率(仅需要 90k 训练轨迹)。