论文

VECTOR-Drive:用于端到端自动驾驶的紧耦合视觉语言和轨迹专家路由

VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving

摘要

端到端自动驾驶需要模型理解交通场景、推断驾驶意图并生成可执行的运动计划。最近的视觉-语言-动作(VLA)模型继承了大规模视觉-语言预训练的语义先验,但仍然面临耦合权衡:完全共享的主干保留了多模态交互,但可能会纠缠语言推理和轨迹预测,而解耦的推理-动作管道减少了任务冲突,但削弱了语义-运动耦合。我们提出了 VECTOR-DRIVE,这是一个基于 Qwen2.5-VL-3B 构建的紧密耦合的 VLA 框架。 VECTOR-DRIVE 通过共享自注意力保持所有词元耦合,并根据词元语义路由前馈计算。视觉和语言标记由视觉语言专家处理以保留语义先验,而目标点、自我状态和噪声动作标记则被路由到轨迹专家以进行特定于运动的计算。在动作词元路径上,流量匹配规划器将嘈杂的动作词元细化为未来的航路点和速度曲线。该设计将语义推理和运动规划结合在单个多模态 Transformer 中,同时分离特定于任务的 FFN 计算。在 Bench2Drive 上,VECTOR-DRIVE 获得了 88.91 的驾驶分数,并且优于代表性的端到端和基于 VLA 的基线。定性结果和消融进一步验证了共享注意力、语义感知专家路由、渐进式训练和基于流程的动作解码的好处。