论文

UniDriveVLA:统一自动驾驶的理解、感知和行动规划

UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

摘要

视觉-语言-动作(VLA)模型最近出现在自动驾驶领域,有望利用丰富的世界知识来提高驾驶系统的认知能力。然而,将此类模型应用于驾驶任务目前面临着空间感知和语义推理之间的关键困境。因此,现有的 VLA 系统被迫做出次优的妥协:直接采用 2D 视觉语言模型会产生有限的空间感知,而用 3D 空间表示增强它们通常会损害 VLM 的本机推理能力。我们认为,这种困境很大程度上源于共享模型参数内空间感知和语义推理的耦合优化。为了克服这个问题,我们提出了 UniDriveVLA,这是一种基于 Mixture-of-Transformer 的统一驾驶视觉-语言-动作模型,通过专家解耦解决感知推理冲突。具体来说,它由三位驾驶理解、场景感知和行动规划专家组成,通过屏蔽联合注意力进行协调。此外,我们将稀疏感知范式与三阶段渐进训练策略相结合,以在保持语义推理能力的同时提高空间感知。大量实验表明,UniDriveVLA 在 nuScenes 上的开环评估和 Bench2Drive 上的闭环评估中实现了最先进的性能。此外,它在广泛的感知、预测和理解任务中表现出强大的性能,包括 3D 检测、在线地图、运动预测和面向驾驶的 VQA,凸显了其作为自动驾驶统一模型的广泛适用性。代码和模型已发布在https://github.com/xiaomi-research/unidrivevla