论文
CausalFlip:超越语义匹配的 LLM 因果判断基准
CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching
摘要
随着大语言模型(LLM)越来越多地部署在复杂、高风险的决策场景中,使其推理扎根于因果而非虚假相关性变得尤为重要。然而,模型在传统推理基准上的强劲表现并不能保证其真正的因果推理能力,因为高准确率可能来自对语义模式的记忆,而非对底层真实因果结构的分析。为弥合这一关键缺口,我们提出新的因果推理基准 CausalFlip,旨在鼓励发展能让 LLM 推理扎根于因果而非语义相关的新范式或训练算法。CausalFlip 由基于事件三元组构建的因果判断问题组成,这些三元组可形成不同的混杂、链式与对撞结构。在此基础上,对每个事件三元组,我们构建语义相似但因果答案相反的问题对,它们复用相同事件,重度依赖语义匹配的模型会被系统性地引向错误预测。为进一步探测模型对语义模式的依赖,我们引入带噪前缀评估,在不改变底层因果关系或推理逻辑的前提下,在中间因果推理步骤之前插入因果无关文本。我们评估了多种训练范式下的 LLM,包括仅答案训练、显式思维链(CoT)监督,以及一种旨在减轻推理过程中对相关性显式依赖的内化因果推理方法。我们的结果显示,显式 CoT 仍可能被虚假语义相关性误导,而内化推理步骤显著改善因果扎根,表明更好地激发基座 LLM 的潜在因果推理能力是有前景的方向。