论文
Robusto-2:利马和纽约市自动驾驶的人类和 VLM 基准测试
Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City
摘要
随着自动驾驶汽车继续在国际上扩张,并使用 VLM 等多模式系统作为其行动模型的认知支柱;这些系统在新环境中的推广效果如何,特别是新地区的分布外 (OOD) 边缘情况?在本文中,我们通过对利马的人类驾驶员、纽约市的人类驾驶员和 VLM 进行全面的因子分析来研究这个开放性问题,并向他们展示从利马和纽约市收集的行车记录仪镜头,在视觉问答 (VQA) 范式下提示他们提出各种问题。我们特别选择这两个城市,因为它们是极具挑战性的驾驶地点,目前还没有自动驾驶汽车公司在其中运营,并提出了涵盖 4 个类别的问题:事实、评级、反事实和推理。我们发现人类和 VLM 的回答存在差异——尽管这是由所提出问题的类型来调节的,并且人类的回答类似,无论他们来自哪里(利马/纽约)。令我们惊讶的是,我们没有发现受地理因素影响的答案(人类或 VLM)存在显着差异,这可能是由于它们的高度分布外性质。我们的数据集位于:https://huggingface.co/datasets/Artificio/robusto-2