论文
迈向视觉语言导航的双脑最小充分表征
Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation
摘要
连续环境中的视觉和语言导航(VLN-CE)需要代理在以自我为中心的观察中基础语言,并在未见过的场景中进行规划。尽管最近的多模态大型模型和基于世界模型的方法改进了导航,但它们通常保留过多的与任务无关的细节,削弱了泛化能力并增加了计算负担。我们提出 BrainNav,一个基于最小充足性原则的导航框架。 BrainNav 由三个组件组成:逻辑锚模型,实现指令感知选择性感知以抑制环境噪声;极简约束对齐模块,充当紧凑的跨模态瓶颈,有效地将离散语言意图与连续潜在动态同步,同时过滤掉冗余信息;压缩世界模型,预测压缩、低秩潜在空间内的动作条件状态。这些模块将语义意图与空间感知结合起来,增强代理在复杂任务中的稳健性和效率。实验表明,BrainNav 在 R2R-CE val-unseen 上的 SR/SPL 方面比之前的 SOTA 提高了 2.0 % / 1.0,在 RxR-CE val-unseen 上提高了 0.94 % / 0.78。这些结果表明,最低限度足够的世界表示为稳健的 VLN 提供了有效的基础。