论文

SymDiag:经神经符号验证的大语言模型推理可解释诊断

SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification

模型推理推理验证与自校正

摘要

大语言模型(LLM)日益充当数据驱动的推理器,但其思维链(CoT)即便在最终答案正确时也可能不忠实。多数现有“验证”信号并不具备诊断性:答案比对只观察结果,LLM裁判给出主观且不可验证的批评,标量奖励(如PRM/RM)对多步推导在何处失败几乎没有洞察。我们提出SymDiag,一个神经符号框架,将推理验证重构为结构化失败诊断。SymDiag把自然语言思维链转译为符号约束并执行步级可满足性/蕴含检查,以(i)定位失败步骤并(ii)生成可验证的诊断证据,包括反例、不一致见证与缺失前提指示。一个核心挑战是:表面上的“逻辑违例”既可能源于真实的推理缺陷,也可能源于神经到符号的转译噪声。因此SymDiag引入自审计器,通过双重符号编码的一致性检查区分转译错误与推理错误,在部分可观测下实现稳健诊断。在数学、逻辑、科学与通用推理等多种基准上,SymDiag提升了对不忠实推理的检测,并在多轮推理修复中提供比结果校验与基于LLM的裁判有效得多的反馈,为可信且可扩展的推理诊断奠定原则性基础。

SymDiag:经神经符号验证的大语言模型推理可解释诊断:论文配图
图1:思维链(CoT)推理的评估范式。结果级与方法级方法将验证视为打分,仅评判最终答案或主观合理性。SymDiag引入诊断级范式,执行符号检查以定位推理失败并产生可验证的诊断证据,从而支持针对性修复。