论文
离散思维的持续行动:端到端自动驾驶的潜在协调规划
Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving
摘要
弥合视觉语言模型的离散推理与自动驾驶的连续、物理约束性质之间的差距仍然是一个重大挑战。在这项工作中,我们介绍了 LaPla,这是一个统一的视觉-语言-动作 (VLA) 框架,具有潜在对齐规划功能,可在精确运动执行中无缝地实现语义理解。我们首先设计一个基于残差矢量量化变分自动编码器(VQ-VAE)的动作分词器,捕获车辆运动学并将轨迹特征编码到结构化潜在空间中。 LaPla 没有采用不可避免地引入量化误差的离散码本查找,而是将这种表示重新用作物理先验,以弥合高维语义和原始动作空间之间的模态差距。具体来说,给定集成多视图图像、历史动作和文本指令的多模态输入,LaPla 结合了并发动作查询,在单个前向传递中因果地关注多模态上下文,将隐藏状态直接投影到预训练的 VQ-VAE 潜在空间中。然后,冻结的解码器将这些连续的潜在变量转化为动作,有效地消除量化误差并确保物理上合理的轨迹,同时绕过耗时的自回归生成。 nuScenes 基准测试的大量实验表明,LaPla 实现了有竞争力的开环性能,与最先进的 VLA 方法相比,长视野 L2 误差降低了 15.52%。 NVIDIA AlpaSim模拟器的闭环评估进一步证实了其在保证驾驶顺利进行方面的卓越能力,将成功率提高了33.34个百分点,并且推理延迟显着降低。