论文
Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的第一步
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
摘要
我们推出了 Qwen-Drive-1.0,这是迈向自动驾驶视觉语言基础模型的第一步。 Qwen-Drive-1.0保留了预训练视觉语言模型(VLM)的架构,并将3D感知、视觉问答和运动规划集成在统一框架内。外部鸟瞰 (BEV) 感知头联合执行 3D 对象检测、语义占用预测和 BEV 地图分割。它充当可从共享表示访问的 3D 信息的探针,并为 3D 场景结构提供显式的、可检查的接口。规划专家以共享 VLM 表示为条件,以生成未来的自我轨迹。分阶段的训练方案将驾驶监督与通用视觉语言数据相结合,以获得特定驾驶能力,同时帮助保持广泛的视觉理解和指令遵循能力。实验证明了强大的 3D 感知和驾驶场景理解,同时在很大程度上保留了一般视觉语言能力。开环、伪闭环和闭环设置的综合评估进一步显示了极具竞争力的运动规划性能。