论文

时间推理不是瓶颈:神经符号问答的概率不一致框架

Temporal Reasoning Is Not the Bottleneck: A Probabilistic Inconsistency Framework for Neuro-Symbolic QA

模型推理推理验证与自校正

摘要

尽管取得了重大进展,大语言模型 (LLM) 在复杂的时间推理任务上仍然表现出脆弱的性能。这种失败模式被广泛归因于自回归逻辑演绎的固有缺陷。在本文中,我们挑战了这种流行的说法,证明时间推理并不是根本瓶颈。相反,失败的根源在于非结构化的文本到事件的表示。我们引入了一种新颖的神经符号问答框架,该框架由概率不一致信号(PIS)控制,该框架明确地将感知错误与推理失败隔离开来。通过将非结构化文本提升为显式事件图和间隔约束,我们的架构严格地将语义提取与符号推理引擎解耦。为了稳健地检测结构断裂,PIS 巧妙地将符号信用区间与通过 LLM 隐藏状态的证据深度学习提取的认知神经不确定性结合起来。实证评估揭示了显着的范式转变:当提供正确的结构表示时,我们系统的显式证明轨迹可实现完美的 1.0 精度 (4000/4000),并且在时间算术基准上严格实现零误报/漏报。在更广泛的噪声注入 QA 设置中,该框架保持了具有竞争力的 75.1% 准确度,同时实现了确定性的步骤级故障定位。最终,通过将表示瓶颈与推理基础隔离,这项工作将时间 QA 从算法推理挑战重新定义为结构对齐问题,为可靠的神经符号人工智能绘制了一条可验证的前进道路。

时间推理不是瓶颈:神经符号问答的概率不一致框架:论文配图
图 1:所提出的神经符号时间 QA 框架概述。该系统将表示(事件/结构提取)与推理(符号证明构造)分开,并采用概率不一致信号(PIS)通过融合信用区间不一致与神经认知不确定性(EDL)来执行步骤级验证。检测到的不一致会触发修复和拓扑突变,形成闭环,实现自适应恢复和可验证推理。