论文
C$^2$Nav:在承诺零射击视觉和语言导航之前进行比较
C$^2$Nav: Compare Before You Commit for Zero-Shot Vision-and-Language Navigation
摘要
连续环境中的零样本视觉和语言导航 (VLN-CE) 越来越多地将基础视觉语言模型 (VLM) 置于导航循环中。现有系统通常请求基本输出,例如航路点、像素、航向、进度值或绝对到达决策,将生成响应与几何量或不可逆转的承诺相耦合。我们研究了一个互补的模型-机器人接口:VLM 比较控制器构造的替代方案,而几何形状、阈值、动作幅度和执行仍保留在物理方面。我们在 C2Nav 中实例化了这个想法,这是一个具有三个协调功能的免训练框架。 Seeing 对经过实际审查的候选人观点进行顺序凝视选举;记住保持紧凑的路线草图并比较相邻的指令段假设;到达结合了犹豫梯、回顾比较和可撤销的走回以实现可靠的停止。在公共OpenNav R2R-CE 100协议上,采用Qwen3-VL-8B-Instruct的C2Nav获得了41.0% OSR、31.0% SR和16.7% SPL,而与标准GPT-5.5模型相同的接口达到54.0% OSR、44.0% SR和29.0% SPL。全院系消融将 SR 降低至 14.0%(无视)、25.0%(无记忆)和 29.0%(无到达)。仅用基本/绝对问题替换比较答案形式的匹配角色倒置将空间、过渡和终端槽中的 SR 分别降低至 12.0%、28.0% 和 21.0%。结果表明,受限决策接口和更强的 VLM 推理是互补的,而不是可以互换的。