论文
“如果……会怎样”的幻觉:评估大语言模型反事实推理的失效
The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs
摘要
反事实推理需要模型能够超越观察到的世界进行推理,并解释改变的条件如何通过下游后果传播。现有的基准主要针对具有固定变量或单一黄金结果的有界设置,忽略了需要因果过程评估的开放域场景。为此,我们提出了 $\textbf{WhatIfBench}$,这是一个开放域、开放形式、长期反事实因果推理的诊断基准,包含跨 STEM、HSS 和混合场景的 220 个假设问题。为了评估自由形式的响应,我们进一步提出 $\textbf{PRISM}$,它首先将每个自然语言解释转换为事件、状态和机制的响应衍生语义因果图。在此图之上,PRISM 然后联合应用评估图级因果有效性的流程指标和评估答案级解释充分性的 Rubric 指标。使用该框架评估六个前沿LLM,我们发现 WhatIfBench 仍远未饱和:即使是最强的模型也只能达到 64.62% 的最终分数。进一步的分析揭示了持续存在的因果差距、前提漂移和拓扑碎片,表明流畅的反事实叙述往往掩盖了脆弱的因果过程。基准测试、代码和评估脚本可在 $\href{https://github.com/zju-gt/WhatIfBench}{WhatIfBench}$ 获取。
