论文
GeoDrive-Bench:自动驾驶中特定区域多模态推理的基准测试
GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving
摘要
用于自动驾驶的视觉语言模型(VLM)已显示出令人鼓舞的性能,但其处理特定区域交通规则的能力仍未得到充分开发,这增加了其在不同全球环境中部署的不确定性。因此,我们推出了 GeoDrive-Bench,这是一种新颖的基准,可以对 VLM 的地理文化驾驶推理进行系统研究。我们在六个国家/地区策划了 5,053 个经过人工验证的多项选择问答对,涵盖了不同的驾驶文化。具体来说,我们强调四个驾驶任务:感知、预测、规划和区域推理。每个问题都需要模型根据视觉证据和当地交通惯例推断正确的驾驶行为,而无需明确的国家/地区标签。除了评估之外,我们还进一步设计了 蒸馏 算法,将特定区域的交通规则知识注入 VLM 的内部表示中,使模型能够更好地将视觉场景理解与本地驾驶策略结合起来。对九个最先进的 VLM 进行的实验显示,每项任务的地理驾驶文化之间存在巨大的性能差异,而我们提出的基线模型则展示了跨地区地理文化推理的改进。这些结果表明,当前的 VLM 仍然缺乏强大的区域感知驾驶智能,并强调 GeoDrive-Bench 作为可部署自动驾驶基础模型的诊断和训练导向测试平台。