论文
连接结构和语言:用于自主道路理解的基于图的视觉推理
Bridging Structure and Language: Graph-Based Visual Reasoning for Autonomous Road Understanding
摘要
对车道几何、拓扑和交通元素关系的结构化道路理解是安全自动驾驶的基础。虽然视觉语言模型 (VLM) 提供了有前途的语义灵活性,但它们缺乏精确道路推理所需的几何和关系基础。相反,传统的模块化系统,例如高清地图和拓扑道路图,提供了结构精度,但在语义上仍然僵化。为了弥补这一差距,我们引入了组合道路基底(CRS),这是一种基于图形的框架,使几何道路结构和开放词汇语义在单一表示中联合执行。 CRS 能够通过递归图查询自动生成成分复杂且语言多样的问答对,并通过“免费基础”机制进行增强,确保对特定地图元素的逻辑可追溯性,并以程序方式提取思想链监督痕迹。我们证明,最先进的 VLM(包括大型闭源模型)在结构化道路推理方面表现不佳,但使用少至 20 到 80 个 CRS 丰富场景来训练 2 或 40 亿参数的小型模型,可以在不同深度的组合推理任务中产生稳定的收益。通过可验证的推理轨迹对模型行为进行分析,揭示了故障模式的系统性转变:基线模型在关系场景理解方面失败,而 CRS 训练的模型减少了属性识别的失败,这表明道路理解的主要瓶颈不是模型规模,而是缺乏结构化监督。