论文

LMGenDrive:连接多模式理解和生成世界建模以实现端到端驾驶

LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving

摘要

近年来,自动驾驶取得了显着进展,但长尾和开放世界场景的泛化仍然是大规模部署的主要瓶颈。为了应对这一挑战,一些工作使用 LLM 和 VLM 进行视觉语言理解和推理,使车辆能够在生成动作时解释罕见和安全关键的情况。其他人研究生成世界模型来捕捉驾驶场景的时空演变,让智能体在行动之前想象可能的未来。受人类智能统一理解和想象力的启发,我们探索了自动驾驶的统一模型。我们推出了 LMGenDrive,这是第一个将基于 LLM 的多模态理解与端到端闭环驾驶的生成世界模型相结合的框架。给定多视图摄像头输入和自然语言指令,LMGenDrive 会生成未来的驾驶视频和控制信号。该设计提供了互补的优势:视频预测改进了时空场景建模,而 LLM 则通过大规模预训练贡献了强大的语义先验和指令基础。我们进一步提出了渐进的三阶段训练策略,从视觉预训练到多步长视距驾驶,以提高稳定性和性能。 LMGenDrive 支持低延迟在线规划和自回归离线视频生成。实验表明,它在具有挑战性的闭环基准测试上显着优于先前的方法,在指令跟踪、时空理解以及对罕见场景的鲁棒性方面有明显的进步。这些结果表明,统一多模态理解和生成是更通用和更强大的具体决策系统的一个有希望的方向。