论文

骨干网规划:通过驱动 VLM 生成本机连续轨迹的 DiffAdapterVLA

Planning in the Backbone: DiffAdapterVLA for Native Continuous Trajectory Generation with Driving VLMs

模型架构Transformer

摘要

预训练的驾驶视觉语言模型 (VLM) 将视觉、路线、语言和驾驶环境集成到丰富的驾驶先验中,但其表示目标​​仍然与连续驾驶规划分开。现有方法通常仅在 VLM 形成最终条件后才开始轨迹生成,将深度条件计算留在轨迹状态的逐步形成之外。我们引入了 DiffAdapterVLA,它在主干中实现了规划:它将显式轨迹标记注入到选定的 VLM 后期层中,将轨迹状态带入主干前向计算中,在其中与不同深度的驾驶条件共同演化。轻量级分层 DiffAdapter 将此计算组织为递归轨迹细化,而不对称联合注意力保留从条件流到轨迹规划的定向指导。通过将规划放置在现有的主干计算中,而不是依赖于独立的轨迹规划器,DiffAdapterVLA 仅采用轻量级轨迹模块,将现有的驾驶先验转化为高效的连续规划能力。 NAVSIM 结果表明,它使用很少的可训练参数实现了低端到端延迟的高质量闭环规划,并证明了 VLM 后期计算中联合演化的轨迹状态和深度驾驶条件有效地实现了连续轨迹规划。