论文

具身视觉和语言导航的全面调查和系统的现实世界评估

A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation

模型评测模型能力评测

摘要

导航是自主系统的一项基本功能,但大多数现有方法依赖于高度结构化的模型和强大的先验假设,限制了它们在开放和不确定的现实环境中的鲁棒性。视觉和语言导航(VLN)通过使机器人能够以数据驱动的方式将自然语言理解与视觉感知相结合,提供了一个有前途的方向。尽管 VLN 引起了越来越多的研究关注,但系统的方法分类和现实世界的验证仍然有限。本调查对 VLN 研究进行了全面回顾。具体来说,最先进的方法是沿着两个正交维度组织的:行动范式,包括分层和整体框架,以及模型范式,包括判别性和生成方法。对它们各自的优点和局限性进行了批判性分析。此外,我们还在物理机器人平台上对代表性 VLN 系统配置进行了系统的现实世界评估。跨越十个不同现实世界场景的实验表明,在测试配置下,模拟和现实世界部署之间存在巨大的性能差距:代表性的单一 RGB 方法在模拟中取得了 61% 的成功率,但在现实世界部署中下降到 22%,而分层框架实现了更高的现实世界成功率,达到 51%,这表明我们的评估设置具有更强的鲁棒性。最后,我们强调了未来研究中必须解决的感知、决策和控制方面的关键挑战。