论文
OneDrive:具有视觉-语言-动作模型的统一多范式驾驶
OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models
摘要
视觉语言模型(VLM)擅长自回归文本生成,但端到端自动驾驶需要具有结构化输出和异构解码行为的多任务学习,例如自回归语言生成、并行对象检测和轨迹回归。为了适应这些差异,现有系统通常引入单独或级联的解码器,从而导致架构碎片化和主干网重用受到限制。在这项工作中,我们提出了一个基于预训练 VLM 构建的统一自动驾驶框架,其中异构解码行为在单个 Transformer 解码器中得到协调。我们证明预训练的 VLM 注意力表现出超越纯语言建模的强大可转移性。通过在单个因果解码器中组织视觉和结构化查询标记,结构化查询可以通过原始的注意机制自然地以视觉上下文为条件。文本和结构化输出共享一个共同的注意力主干,从而实现跨异构任务的稳定联合优化。通过引入结构化轨迹查询,在相同的因果 LLM 解码器中实现轨迹规划。这种统一的公式使得规划能够与图像和感知标记共享预训练的注意力主干。端到端自动驾驶基准的大量实验展示了最先进的性能,包括 nuScenes 开环评估的 0.28 L2 和 0.18 碰撞率以及 NAVSIM 闭环评估的竞争结果 (86.8 PDMS)。完整模型保留了多模态生成能力,而高效的推理模式可将延迟降低约 40%。代码和模型可在 https://github.com/Z1zyw/OneDrive 获取