论文

KLDrive:基于知识图谱的自动驾驶细粒度3D场景推理

KLDrive: Fine-Grained 3D Scene Reasoning for Autonomous Driving based on Knowledge Graph

上下文与知识知识图谱

摘要

自动驾驶需要对细粒度3D场景事实进行可靠推理。在多模态驾驶观测上进行细粒度问答为评估该能力提供了自然途径,但现有感知流水线和面向驾驶的大语言模型(LLM)方法仍存在场景事实不可靠、幻觉、推理不透明以及严重依赖任务特定训练的问题。我们提出KLDrive,首个面向自动驾驶细粒度问答的知识图谱增强LLM推理框架。KLDrive通过设计两个紧耦合组件解决该问题:一个基于能量的场景事实构建模块,将多源证据整合为可靠的场景知识图谱;以及一个LLM智能体,在显式结构约束下于受限动作空间上进行基于事实的推理。通过将结构化提示与少样本上下文示例相结合,该框架无需大量任务特定微调即可适配多样推理任务。在两个大规模自动驾驶问答基准上的实验表明,KLDrive超越了先前最先进方法,在NuScenes-QA上取得65.04%的最佳总体准确率,在GVQA上取得42.45的最佳SPICE分数。在最具挑战性的事实推理任务计数上,它比最强基线提升46.01个百分点,展示了大幅降低的幻觉以及可靠场景事实构建与显式推理耦合的收益。

KLDrive:基于知识图谱的自动驾驶细粒度3D场景推理:论文配图
图1:KLDrive借助3D场景知识图谱与工具受限的LLM智能体,实现基于事实的自动驾驶场景问答。