论文

从场景图到答案:自动驾驶的选择性神经符号推理

From Scene Graphs to Answers: Selective Neuro-Symbolic Reasoning for Autonomous Driving

模型推理推理策略与问题分解

摘要

自动驾驶问答需要对结构化场景信息进行推理,但现有的视觉语言方法很大程度上将异构推理操作委托给单个神经推理过程。我们认为,这种统一策略忽略了一个根本区别:一些查询允许精确的符号解决方案,而另一些则需要语义解释。我们引入了一种查询自适应神经符号推理框架,该框架根据查询的性质显式分配计算。其核心是分层时空场景图(STSG),它将持久对象身份与特定于帧的状态分开,并将空间关系和时间转换表示为显式有向结构。给定一个查询,符号执行器首先尝试通过精确的图操作来解决它;仅当符号执行弃权时,才会调用 LLM 进行语义推理。对于这些未解决的查询,查询条件图检索和证据过滤保留了关系方向、时间局部性和对象语义,为LLM提供了紧凑且经过验证的任务相关证据。这种设计将LLM的角色从通用推理引擎转变为有针对性的语义推理器,同时允许准确有效地处理确定性计算。我们在预言机感知设置下针对 nuScenes v1.0-mini 所有 10 个场景中的 5,916 个 NuScenes-QA 问题评估了该框架。整个系统使用 GPT-5.4-mini 实现了 80.63% 的总体准确率,比相应的仅 LLM 配置提高了 5.48 个百分点;使用 DeepSeek-V4-Flash 时,改进达到 6.64 点。最大的进步出现在计数问题上,分别提高了 10.20 分和 12.61 分。这些结果表明选择性推理提高了准确性和推理效率。