论文

神经符号驾驶:面向驾驶VLA的规则锚定忠实推理

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

模型训练监督微调与指令调优

摘要

引入思维链(CoT)推理的驾驶VLA模型很有吸引力——它们利用预训练VLM表示并以自然语言暴露中间决策——但当前理据常缺少保持理据与规划运动因果连接所需的逐步决策语义。我们介绍Neuro-Symbolic Drive——神经符号驾驶框架:以直接从经典基于规则的规划器抽取的规则锚定推理踪迹监督驾驶VLA。我们的关键观察是:基于规则的规划器本就是作为可执行推理引擎运作的符号AI系统——它们对主动安全约束推理、在候选机动上搜索并选择最终轨迹。我们在仿真中对这些规划器插桩——捕获执行轨迹与每个规则评估步的内部决策踪迹。每条踪迹被序列化为结构化规则锚定推理——与轨迹配对微调Qwen3.5-4B作为驾驶VLA。因为这些踪迹直接源自决定动作的规划器状态——它们在构造上保证推理与运动生成结构性耦合——而非事后对齐。在我们仿真器生成的基准上——在三相机感知下——详细的规则锚定推理把ADE@3s从0.47降到0.26、错过率从8.30%降到6.40%;八相机感知下从0.54降到0.26、10.13%降到5.99%。Neuro-Symbolic Drive由此把神经符号规划逻辑转为结构化监督。代码库: https://github.com/XiangboGaoBarry/Neural-Symbolic-Drive。

神经符号驾驶:面向驾驶VLA的规则接地忠实推理:论文配图
图 1:神经符号驱动概述。左侧从基于规则的规划器中提取结构化决策轨迹。对于每个模拟驾驶场景,规划器跟踪会公开主动约束、相关代理、候选操作、安全门、评分组件和最终选择。场景感知选择器选择与场景系列最匹配的跟踪。右侧使用这些痕迹来监督行驶的 VLA,因此模型学习共同产生忠实的推理和相应的未来轨迹。