论文
DVGT-2:大规模自动驾驶的视觉-几何-动作模型
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
摘要
端到端自动驾驶已经从基于稀疏感知的传统范式演变为视觉-语言-动作(VLA)模型,该模型专注于学习语言描述作为辅助任务以促进规划。在本文中,我们提出了另一种视觉-几何-动作(VGA)范式,主张将密集的 3D 几何作为自动驾驶的关键线索。由于车辆在 3D 世界中运行,我们认为密集的 3D 几何形状可以为决策提供最全面的信息。然而,大多数现有的几何重建方法(例如,DVGT)依赖于计算昂贵的多帧输入批处理,并且不能应用于在线规划。为了解决这个问题,我们引入了流式驾驶视觉几何Transformer(DVGT-2),它以在线方式处理输入并联合输出当前帧的密集几何和轨迹规划。我们采用时间因果注意力和缓存历史特征来支持即时推理。为了进一步提高效率,我们提出了滑动窗口流策略,并在一定间隔内使用历史缓存以避免重复计算。尽管速度更快,DVGT-2 在各种数据集上实现了卓越的几何重建性能。相同的经过训练的 DVGT-2 可以直接应用于跨不同相机配置的规划,而无需 微调,包括闭环 NAVSIM 和开环 nuScenes 基准。