论文
Geo-VLA:通过地图语义内化进行几何感知视觉-语言-动作规划
Geo-VLA: Geometry-Aware Vision-Language-Action Planning via Internalization of Map Semantics
摘要
视觉-语言-动作(VLA)模型通过利用语义推理和长尾泛化的基础模型来实现先进的端到端自动驾驶。然而,它们的规划性能在复杂的驾驶环境中仍然受到限制,因为仅图像表示不足以捕获规划相关的道路几何形状和拓扑。在本文中,我们提出了 Geo-VLA,这是一种即插即用框架,可通过学习几何感知视觉表示来增强 VLA 模型。在训练过程中,Geo-VLA 内化几何地图语义以增强道路结构表示,同时在推理过程中不需要高清地图或额外的车道信息。为了支持这种方法,我们引入了 Geo-QA,这是一个以几何为中心的问答数据集,它通过对比学习和指令调整将道路几何形状注入视觉语言表示中。 NAVSIM v1 上的实验表明,Geo-VLA 通过独特的动作生成架构持续改进 VLA 规划器,实现了 92.1 PDMS,并在单相机 VLA 规划器中建立了新的最先进水平。