论文

CoVLM-Bench:协作驾驶问答和规划的真实世界基准

CoVLM-Bench: A Real-World Benchmark for Cooperative Driving Question Answering and Planning

模型评测基准与评测资源

摘要

视觉语言模型(VLM)在自动驾驶方面取得了实质性进展,但它们的成功主要是在以自我为中心的场景中研究的。基础设施侧观察提供了超出自我车辆视野的视图,而传统的协作驾驶系统通常将它们转换为几何表示,以供下游感知和规划。将这些视图直接合并到 VLM 中提供了改进协作场景理解和轨迹规划的机会。然而,问题回答和轨迹规划尚未在相同的真实车辆基础设施场景上进行联合评估。我们提出了 CoVLM-Bench,这是针对车辆-基础设施配对场景的协作驾驶问答(CDQA)和协作规划(CP)的基准。 CoVLM-Bench 提供基于场景的 CDQA 注释、作为辅助监督的三部分理由,以及从记录的自我运动中得出的未来轨迹目标。它包含 2,196 个配对帧和 35,136 个 CDQA 注释,而 CP 在三秒范围内预测六个航路点。这些注释结合了模型辅助绘图、基于记录的计算和人工验证。在 CoVLM-Bench 的基础上,我们引入了 CoVLM-Drive,这是一个统一的 VLM 基线,直接使用 CDQA 和 CP 的配对视图。实验表明,CDQA 适应提高了答案准确性,并且 CoVLM-Drive 的 FDE 比对比的 V2X 规划器更低; QA 初始化和理由监督都可以减少计划错误。 CoVLM-Bench 和 CoVLM-Drive 共同支持 VLM 的训练和比较,以实现协作场景理解和规划。