论文
SymDiag:经神经符号验证的大语言模型推理可解释诊断
SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification
摘要
大语言模型(LLM)日益充当数据驱动的推理器,但其思维链(CoT)即便在最终答案正确时也可能不忠实。多数现有“验证”信号并不具备诊断性:答案比对只观察结果,LLM裁判给出主观且不可验证的批评,标量奖励(如PRM/RM)对多步推导在何处失败几乎没有洞察。我们提出SymDiag,一个神经符号框架,将推理验证重构为结构化失败诊断。SymDiag把自然语言思维链转译为符号约束并执行步级可满足性/蕴含检查,以(i)定位失败步骤并(ii)生成可验证的诊断证据,包括反例、不一致见证与缺失前提指示。一个核心挑战是:表面上的“逻辑违例”既可能源于真实的推理缺陷,也可能源于神经到符号的转译噪声。因此SymDiag引入自审计器,通过双重符号编码的一致性检查区分转译错误与推理错误,在部分可观测下实现稳健诊断。在数学、逻辑、科学与通用推理等多种基准上,SymDiag提升了对不忠实推理的检测,并在多轮推理修复中提供比结果校验与基于LLM的裁判有效得多的反馈,为可信且可扩展的推理诊断奠定原则性基础。
