论文

CMU-Drive与V2V-VLA:协作多智能体统一驾驶推理基准与车对车视觉-语言-动作模型

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

智能体系统Agent任务评测

摘要

视觉-语言-动作(VLA)模型近来在端到端自动驾驶上取得了令人印象深刻的表现,但现有方法主要为单个自动驾驶智能体设计,对协同感知、推理与规划的支持有限。我们提出协作多智能体统一驾驶与推理(CMU-Drive),一个闭环端到端基准,用于评测多辆网联自动驾驶车辆(CAV)在包含背景交通参与者的安全关键驾驶场景中协同自动驾驶的表现。我们进一步提出车对车视觉-语言-动作(V2V-VLA),一个协同VLA模型,通过联合生成驾驶动作、未来路径点、语言推理和通信策略,将协同驾驶整合进单次前向传播。在CMU-Drive上的实验建立了协同VLA驾驶的首个基准与基线,并为多智能体、闭环、端到端协同自动驾驶的未来研究奠定了基础。我们的代码、基准与模型检查点将公开发布,以促进开源研究。

CMU-Drive与V2V-VLA:协作多智能体统一驾驶推理基准与车对车视觉-语言-动作模型:论文配图
图2:V2V-VLA模型架构。输入包括语言提示、目标路径点,以及从自车前视摄像头图像与自车和所选通信车辆的合并占据地图导出的视觉token。输出包括用于动作、推理和通信的语言输出,以及未来路径点。