论文
FutureNav:用于视觉和语言导航的统一世界动作建模
FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation
摘要
连续环境中的视觉和语言导航(VLN)需要代理在以自我为中心的观察中提供基础指令,同时保持对长动作序列的空间理解。最近的导航基础模型通过扩展视觉语言模型显示出巨大的进步,但它们通常主要将导航学习为直接动作生成,而没有明确地建模世界状态或预测其未来的演变。我们介绍 FutureNav,一个基于 VLM 的统一世界动作建模框架,用于视觉和语言导航。具体来说,FutureNav 联合编码文本、视觉和空间特征,并将它们输入 LLM,并优化同步世界和动作建模的四个目标:用于导航动作预测的动作策略目标、用于建模状态转换的反向和前向动态目标以及用于预测未来空间状态的下一代目标。这种统一的架构增强了动作预测,同时显式地对世界进行建模,而不会牺牲推理速度。大量实验表明,仅用 4B 规模的主干网,FutureNav 在多个 VLN 基准测试中就实现了最先进的性能,并且大大优于先前的 VLN 方法,为 VLN 的未来世界行动模型铺平了道路。我们将发布代码和模型以支持未来的研究。