论文

通过符号验证揭示LLM因果推理中的隐性正确

Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification

模型评测评测方法与指标

摘要

大语言模型(LLM)越来越多地被应用于涉及因果推理的任务。然而,当前基准常依赖字符串匹配或表面级指标,无法捕捉模型输出在因果推理语义下是否形式有效。为此,我们提出DoVerifier,一个简单的符号验证器,使用do演算和概率论的规则检查LLM生成的因果表达式是否可从给定因果图推导。这使我们能够恢复那些原本会因因果语义的表面差异而被判为错误的因果查询正确答案。我们在合成数据和因果问答基准上的评估表明,DoVerifier更准确地捕捉因果推理轨迹的语义正确性,为在因果推理上评估LLM提供了更严格、信息更丰富的方式。