论文

DeepSight:通过端到端自动驾驶的潜在状态预测进行长视野世界建模

DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving

模型架构新型架构

摘要

端到端自动驾驶系统越来越多地集成视觉语言模型(VLM)架构,结合文本推理或视觉推理来增强驾驶决策的稳健性和准确性。然而,大多数方法中采用的推理机制都是直接改编自一般领域,缺乏针对自动驾驶场景的深入探索,特别是在视觉推理模块中。在本文中,我们提出了一种驾驶世界模型,该模型可以对鸟瞰(BEV)空间中连续的未来帧的潜在语义特征进行并行预测,从而实现未来世界状态的长视野建模。我们还引入了一种高效且自适应的文本推理机制,该机制利用额外的社会知识和推理能力来进一步提高在具有挑战性的长尾场景中的驾驶性能。我们提出了一种新颖、高效且​​有效的方法,可在闭环 Bench2drive 基准测试中实现最先进 (SOTA) 的结果。代码位于:https://github.com/hotdogcheesewhite/DeepSight。