论文

STAIR:用于时间问答中可解释推理的语义时间自动机

STAIR: Semantic-Temporal Automaton for Interpretable Reasoning in Temporal Question Answering

模型推理推理策略与问题分解

摘要

通过利用大规模预训练,LLM 可以解释不同的时间表达式和问题表述,而无需特定于任务的训练。然而,现有的基于提示的神经符号系统继续依赖 LLM 进行语义解释和精确的时间推理。因此,有关间隔、时间锚和有序状态的离散决策仍然容易受到概率错误的影响并且难以验证。我们提出 STAIR,一个用于 \textbf{I}n 可解释的 \textbf{R} 推理的 \textbf{S}emantic-\textbf{T}emporal \textbf{A}utomaton。 STAIR 将语义解释与精确的时间推理分开:无答案的 LLM 适配器将复杂的问题表述映射到标准化的时间意图,而具有有限控制和保护转换的确定性时间自动机则对规范化证据执行相应的策略。遵循规则优先的设计,STAIR 无需调用 LLM 即可解决标准问题,并且仅在规则路径无法生成可执行意图时才应用语义适应。这种方法减少了自由形式的推理,使临时决策可验证和可解释。具体来说,受保护的执行支持精确的时间点包含和之前/之后的选择,而语义适应则处理非精确的间隔和时间锚定的查询。在 TimeQA-Easy、TimeQA-Hard、TempReason-L2 和 TempReason-L3 数据集中,STAIR 在使用匹配模型设置的 TQA 任务中始终优于强基线,在使用 Qwen2.5-7B 和 GPT-4o-mini 模型时分别实现平均 F1 改进 16.57\% 和 3.10\%。此外,消融和诊断分析表明 STAIR 擅长处理边界敏感和顺序敏感查询,而其受保护的执行和语义适应分别确保精确的点时间推理和不精确的间隔。