论文

LVDrive:潜在视觉表示增强视觉-语言-动作自动驾驶模型

LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型已成为端到端自动驾驶的一个有前景的框架。然而,现有的 VLA 通常依赖于稀疏的动作监督,这没有充分利用其强大的场景理解和推理能力。最近通过世界建模整合密集视觉监督的尝试往往过分强调像素级图像重建,而忽略了语义上有意义的场景表示学习。在这项工作中,我们提出了 LVDrive,一种用于自动驾驶的潜在视觉表示增强的 VLA 框架。 LVDrive 在 VLA 范式中引入了未来场景预测任务,其中未来表示完全在预训练视觉主干的辅助监督下在高级潜在空间中学习。与低效的自回归生成不同,我们在统一的嵌入空间内对未来场景和运动预测进行联合建模,并在单个前向传递中进行处理以进行未来感知推理。我们进一步设计了一种两阶段轨迹解码策略,该策略显式地利用学习到的潜在未来表示来完善轨迹生成。对具有挑战性的 Bench2Drive 基准进行的大量实验表明,LVDrive 在闭环驾驶性能方面取得了显着改进,优于动作监督方法和基于图像重建的世界模型方法。