论文

V2X-QA:跨自我、基础设施和合作视图的自动驾驶多模式 大语言模型 的综合推理数据集和基准

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在自动驾驶方面表现出了巨大的潜力,但现有的基准在很大程度上仍然以自我为中心,因此无法系统地评估以基础设施为中心和协作驾驶条件下的模型性能。在这项工作中,我们介绍了 V2X-QA,这是一个现实世界的数据集和基准,用于跨车辆端、基础设施端和合作视角评估 MLLM。 V2X-QA 围绕视图解耦评估协议构建,可在统一的多项选择问答 (MCQA) 框架内,在仅车辆、仅基础设施和协作驾驶条件下进行受控比较。该基准被组织成涵盖感知、预测、推理和规划的 12 项任务分类法,并通过专家验证的 MCQA 注释构建,以实现对视点相关能力的细粒度诊断。十个代表性的最先进的专有和开源模型的基准结果表明,视点可访问性极大地影响性能,并且基础设施端推理支持有意义的宏观流量理解。结果还表明,合作推理仍然具有挑战性,因为它需要跨视图对齐和证据整合,而不仅仅是额外的视觉输入。为了应对这些挑战,我们引入了 V2X-MoE,这是一个与基准一致的基线,具有明确的视图路由和特定于观点的 LoRA 专家。 V2X-MoE 的强劲性能进一步表明,显式视点专业化是自动驾驶中多视点推理的一个有前途的方向。总体而言,V2X-QA 为研究互联自动驾驶中的多视角推理、可靠性和协作物理智能奠定了基础。数据集和 V2X-MoE 资源可公开获取:https://github.com/junwei0001/V2X-QA。