论文

LWDrive:自动驾驶的分层世界模型引导视觉语言模型规划

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving

模型推理推理搜索与路径规划

摘要

视觉语言模型 (VLM) 为端到端自动驾驶 (E2E-AD) 规划提供强大的语义理解和常识推理。然而,VLM 直接生成的轨迹通常仅编码粗略的驾驶意图,并且不足以实现几何精确、未来感知和基于多视图的规划。为了解决这些限制,我们开发了逐层世界模型引导驾驶框架(LWDrive)。 LWDrive 是一个 VLM 规划框架,通过分层世界模型指导细化粗略轨迹。 LWDrive 没有将 VLM 输出视为最终轨迹,而是将其用作意图感知的粗略计划,围绕其扩展多样化的候选空间,并通过 Foresight Cascade Planner (FCP) 逐步细化候选。具体来说,我们引入未来帧生成监督来鼓励 VLM 学习前瞻性场景表示,从而将与规划相关的预测动态注入其内部隐藏状态。基于这些世界模型监督表示,FCP 利用跨多个层的 VLM 特征,并集成历史时间状态、动作查询表示和当前帧多视图鸟瞰图 (BEV) 特征,以从粗到细的方式细化候选轨迹。这种设计能够逐步校正空间位置和运动趋势,同时利用多视图场景线索进行轨迹细化,并保留大型模型产生的高级驾驶意图。最后,评分头评估细化后的候选者并选择最佳轨迹作为最终规划输出。实验表明,LWDrive 在 NAVSIM 基准上获得了 92.0 的分数,在 NAVSIM-v2 上获得了 89.6 的分数。代码和模型将公开。