论文

应对 doScenes 指导驾驶挑战赛的 DVDrive 方法

A DVDrive Approach for doScenes Instructed Driving Challenge

模型架构Transformer

摘要

指令条件轨迹预测是自动驾驶中的一个新兴问题,其中模型不仅根据视觉场景上下文和历史运动,而且根据自然语言操纵指令来预测未来的自我轨迹。本文介绍了我们向 doScenes 指导驾驶挑战赛提交的作品,该挑战赛基于 OmniDrive,一种具有 3D 感知、推理和规划功能的视觉-语言-动作驾驶代理。我们通过在带指令注释的 nuScenes 场景上训练 OmniDrive 并生成由 12 个未来路点表示的 6 秒自我轨迹,使 OmniDrive 适应 doScenes 设置。为了改善多视图视觉定位,我们进一步在 OmniDrive 感知头中引入了 DVPE 式分视图感知模块。所提出的模块不是全局注意力作用于所有相机特征,而是将查询特征和图像标记分组到划分的局部视图空间中,并在每个视图内执行可见性感知交叉注意力。这种设计减少了不相关的交叉视图干扰,并帮助模型更好地将语言指令与本地驾驶相关的视觉证据结合起来。该代码可在以下位置公开获取:https://github.com/feel12348/doscenes-omnidrive。