论文
SkillNav:零射击目标导航的分数级技能干预
SkillNav: Score-Level Skill Intervention for Zero-Shot Object Goal Navigation
摘要
视觉语言模型(VLM)代理具有先进的零样本目标目标导航,但单帧推理使它们缺乏具体导航器所需的跨步骤行为意识,从而产生反复出现的故障,例如死胡同、室内循环和检测到目标的迂回方法。基于提示的补救措施使 词元预算 跨多个子模块情节膨胀,但仍然难以编码固有的空间信号,例如角度、地图单元和视点坐标。在本文中,我们提出了 SkillNav,这是一种用于基于 VLM 的导航的可扩展行为技能框架,它将现代 VLM 导航器已经维护的好奇心价值图视为可写基底,可组合技能以零词元成本在其上刻录行为记忆。技能根据其行为权威级别分为三层,即按比例重新加权的软缩放、区域级保证的下限提升以及阈值触发的强制行动的硬覆盖,并在固定的组合顺序下跨层合作,在技能之间建立可预测的、声明的优先级。这种设计将能力改进转化为技能注册:无需重新训练 VLM 或干扰现有技能即可插入新行为,从而为持续改进开辟了道路。最小的提示通道通过类别级语义提示补充了分数级技能,从而产生了双重表示设计,其中空间记忆存在于地图上,语义记忆存在于简短的提示中。 无需训练,SkillNav 在 MP3D (25.5)、HM3D v0.1 (39.3) 和 HM3D v0.2 (43.2) 上建立了新的最先进的 SPL,与最强的现有方法相比,SPL 绝对提高了 6.0,并在 HM3D v0.1 (69.7) 和 v0.2 上实现了最高的成功率(75.9)。