论文

视觉基础模型可以导航吗?零样本现实世界评估和经验教训

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

模型评测模型能力评测

摘要

视觉导航模型(VNM)通过从大规模视觉演示中学习,有望实现通用的机器人导航。尽管现实世界的部署不断增加,但现有的评估几乎完全依赖于成功率、机器人是否达到目标,这掩盖了轨迹质量、碰撞行为和对环境变化的鲁棒性。我们对两个机器人平台和跨越室内和室外的五个环境中的五种最先进的 VNM(GNM、ViNT、NoMaD、NaviBridger 和 CrossFormer)进行了实际评估。除了成功率之外,我们还将基于路径的指标与基于视觉的目标识别分数相结合,并通过受控图像扰动(运动模糊、太阳耀斑)评估鲁棒性。我们的分析揭示了三个系统局限性:(a)即使是结构复杂的扩散和基于 Transformer 的模型也表现出频繁的冲突,表明几何理解有限; (b) 模型无法区分感知相似的不同位置,但存在一些语义差异,导致重复环境中的目标预测错误; (c) 分布变化导致性能下降。我们将公开发布我们的评估代码库和数据集,以促进 VNM 的可重复基准测试。