论文

分层驱动 VQA 中的跨阶段一致性:显式基线和学习门控上下文投影仪

Cross-Stage Coherence in Hierarchical Driving VQA: Explicit Baselines and Learned Gated Context Projectors

应用与实践行业应用

摘要

自动驾驶的图形视觉问答(GVQA)将推理组织为有序阶段,即感知、预测和规划,其中规划决策应与模型自身的感知保持一致。我们使用两种互补机制对 DriveLM-nuScenes 上的跨阶段上下文传递进行了比较研究。显式变体无需额外训练即可在域适应的 4B VLM (Mini-InternVL2-4B-DA-DriveLM) 上评估三种基于提示的调节策略,将 NLI 矛盾减少高达 42.6%,并建立强大的零训练基线。隐式变体引入了门控上下文投影仪,它从一个阶段提取隐藏状态向量,并将归一化的门控投影注入到下一阶段的输入嵌入中。这些投影仪与舞台专用 QLoRA 适配器在通用 8B VLM (InternVL3-8B-Instruct) 上进行联合训练,同时仅更新约 0.5% 的参数。隐式变体在规划阶段 NLI 矛盾方面实现了统计上显着的 34% 减少(引导 95% CI,p < 0.05),并将跨阶段蕴涵增加了 50%,使用多语言 NLI 分类器进行评估以考虑混合语言输出。规划语言质量也有所提高(CIDEr +30.3%),但由于缺乏驱动域预训练,词汇重叠和结构一致性会下降。由于这两个变体使用不同的基础模型,我们将它们作为补充案例研究:显式上下文传递为表面一致性提供了强大的 无需训练 基线,而隐式门控投影提供了显着的规划阶段语义增益,表明域适应作为全谱改进的下一个合理因素。