论文

DriveStack-VLA:基于 BEV 的 DeepStack 视觉-语言-动作模型的渲染-教师对齐

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

模型训练监督微调与指令调优

摘要

视觉-语言-行动驾驶模型将预训练的视觉-语言模型转换为驾驶策略,使它们能够使用世界知识并遵循语言指导。然而,现有的VLA驾驶模型仍然缺乏面向驾驶的空间智能:它们的策略主要基于透视图像标记和语言先验,而精确的运动规划需要度量几何、自上而下的场景结构以及对安全关键感知线索的关注。这种限制使得当前模型容易受到弱视觉几何建模和专家演示中感知覆盖的影响。在本文中,我们介绍了 DriveStack-VLA,这是一个构建在大型 VLM 主干上的框架。为了加强VLA驾驶的空间几何依据,我们开发了双视觉建模组件。我们通过 DeepStack 式连接将鸟瞰图表示注入到 大语言模型 解码器中,并提出渲染-教师对齐来将真实图像的感知焦点与光栅化图像的感知焦点对齐。此外,为了弥补多模态轨迹选择方面的差距,我们引入了一种基于头部的自我批评模块,该模块对采样轨迹进行排序并有条件地细化最佳轨迹。 DriveStack-VLA 在 NAVSIMv1 上获得 91.6 PDMS,在 NAVSIMv2 上获得 91.0 EPDMS(启用人工惩罚过滤器),在闭环 Bench2Drive 上获得 79.49 的驾驶分数,成功率为 56.36%。我们的项目页面上提供了更多可视化效果:https://anonymous.4open.science/w/drivestack-vla/。