论文

VLGA:自动驾驶的视觉-语言-几何-动作模型

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

摘要

视觉-语言-动作 (VLA) 模型可以用语言描述场景并对其进行推理,但仍然难以将其动作扎根于周围密集的 3D 世界中。现有方法要么从冻结的 3D 基础模型中注入特征,但没有确保策略使用这些特征的目标,要么用稀疏框和地图损失来约束几何图形,而这些损失不提供密集的空间信号。我们介绍 VLGA,这是第一个受监督的视觉-语言-动作模型,用于重建其所穿过的密集 3D 世界。 VLGA 通过专门的专家引入几何作为视觉、语言和动作之外的第四种模态,并由针对 LiDAR 的每像素点图回归损失进行监督。在具有挑战性的 nuScenes 和 Bench2Drive 数据集上分别进行开环和闭环评估的大量实验表明,VLGA 相对于对应的 VLA 方法具有优越性。特别是,在开环 nuScenes 上,VLGA 在没有自我状态的 VLA 方法中树立了新的技术水平,具有最低的 L2(平均 0.50\,m)和 3 秒碰撞率(0.18\%)。在闭环 Bench2Drive 上,VLGA 在相当的效率和舒适度下获得了 79.08 的最先进驾驶分数,比之前最强的 VLA 高出 0.71。