论文
D2-V2X:自动驾驶的深度驱动协作 V2X 推理
D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving
摘要
单车视觉语言模型 (VLM) 从根本上受到传感器遮挡的限制。虽然车联网 (V2X) 系统可以缓解这一问题,但当前的基准测试缺乏解决复杂环境中的歧义所需的协作推理。我们推出了 D2-V2X,这是一种空间感知问题-基本原理-答案 (QRA) 基准,具有来自多式联运车辆和基础设施传感器的 8,500 个三元组。我们还建立了一个基线,将 3D LiDAR 特征与 VLM 的潜在空间对齐。通过在结构化 JSON 输出之前强制执行自然语言思想链基本原理,我们的模型被迫明确阐明空间关系。我们的实验表明,与零射击模型中接近零的召回率相比,协作 LiDAR 中的视觉依据关联 VLM 在识别遮挡危险方面实现了 24.4% 的召回率,并且与零射击基线相比,可见物体的空间估计误差降低了 77%。虽然该模型的功能决策 F1 得分为 53.5,但我们认为 3D 到 2D 投影是当前 VLM 架构的基本瓶颈,为未来创新建立了新的基准。数据、代码和训练模型可在 https://github.com/KevinRichard1/D2-V2X 获取