论文

Bench2Drive-VL:使用视觉语言模型的闭环自动驾驶基准

Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models

智能体系统Agent任务评测

摘要

随着视觉语言模型(VLM)的兴起,其在自动驾驶(VLM4AD)方面的应用引起了广泛关注。同时,在自动驾驶领域,闭环评估已被广泛认为是比开环评估更可靠的验证方法,因为它可以评估模型在累积误差和分布外输入下的性能。然而,现有的 VLM4AD 基准测试是在开环下评估模型的场景理解能力,即通过静态问答 (QA) 数据集。这种评估无法评估人类收集的数据集中很少出现的分布外状态下的 VLM 性能。为此,我们提出了 Bench2Drive-VL,它是 Bench2Drive 的扩展,为基于 VLM 的驾驶带来了闭环评估,它引入了:(1)DriveCommenter,一个闭环生成器,可以针对 CARLA 中的所有驾驶情况自动生成多样化的、基于行为的问答对,包括以前的严重偏离路线和越野偏差。模拟中无法评估。 (2) 统一的协议和接口,允许现代VLM直接插入Bench2Drive闭环环境中,以与传统代理进行比较。 (3)灵活的推理和控制框架,支持多格式的视觉输入和可配置的基于图的思维链执行。 (四)完整的开发生态系统。这些组件共同构成了 VLM4AD 的综合闭环基准测试。所有代码和带注释的数据集都是开源的。