论文

GeoCoTDrive:为自动驾驶视觉语言动作模型引入几何推理证据

Explicit Geometric Chain-of-Thought for Vision-Language-Action in Autonomous Driving

模型推理模型训练应用与实践监督微调与指令调优推理策略与问题分解机器人

摘要

视觉-语言-动作(VLA)模型已成为自动驾驶的一个有前途的范例。然而,现有的 VLA 模型仍然存在根本性的不匹配:驾驶动作需要精确的 3D 几何线索,而视觉语言理解和推理主要在 2D 语义空间中进行。在本文中,我们提出了 GeoCoTDrive,这是一种明确的几何思想链框架,以面向规划的方式为几何奠定基础。 GeoCoTDrive 遵循 2D 优先思考、专用 3D 先验驱动范例。它首先对与决策关键线索相对应的 2D 区域进行Grounding,然后通过从Grounding区域内的几何基础模型中采样特征来检索局部 3D 先验。这些局部几何特征被交织到自回归上下文中以支持轨迹生成。为了监督这一过程,我们引入了与规划相关的Grounding,这是一种新的区域级Grounding任务,重点关注直接影响自我规划决策的局部空间线索,并构建了 PlanningGrounding 数据集以赋予 VLA 规划导向的Grounding能力。跨多个端到端自动驾驶基准的实验表明,GeoCoTDrive 持续提高了安全关键规划性能,证明了基于 VLA 的规划的显式几何思维链过程的有效性。

GeoCoTDrive:为自动驾驶视觉语言动作模型引入几何推理证据:论文原图
图 1:VLA 几何集成范例的比较。 (a) 结构-感知融合注入代理和地图标记。 (b) 几何融合包含全局几何标记。 (c) GeoCoTDrive 引入了显式几何思想链:VLM 首先接地规划相关区域,然后检索局部 3D 几何先验,最后将接地文本与几何标记交错以条件轨迹生成。