论文

从因果合理性到因果可靠性:将 LLM 评估为校准的直接因果边缘分类器

From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)越来越多地用于为结构因果发现提供先验因果知识,但其直接边缘判断和置信度是否可信仍不清楚。我们系统地评估了 12 个指令调整的开放权重模型,涵盖 6 个基准因果图、5 种提示策略和 4 个置信源:语言化、基于 logits、交叉提示一致性和跨模型一致性。根据我们的仅语言成对协议,我们的评估得出了三个关键发现。 (i) 基于 LLM 的因果判断是召回主导的:模型预测具有许多假阳性边缘的过于密集的图,而提示主要改变精确率与召回率的权衡,而不是解决过度预测。模型规模的收益在最大的图表上会减少,并且不会消除错误校准。 (ii) LLM 通常捕获因果相关性,但无法可靠地识别直接性或方向。相对于已发布的参考图,模型将 40.0% 的间接非边缘和 36.0% 的反向非边缘错误分类为直接边缘,而将其他非边缘错误分类为 28.2%。此外,这些误报中 80.8% 和 84.6% 的口头置信度至少为 80%,这揭示了对结构性错误预测的严重过度自信。 (iii) 传统的置信度估计不可靠,而一致性则提供了更有希望的信号。无论正确性如何,基于 logits 的置信度经常崩溃在 1.0 附近,而交叉提示和跨模型一致性实现了更好的均值校准和区分,尽管它们的优势在 Holm 校正后并不具有统计显着性。基准熟悉度审计进一步确定了五个模型数据集对的潜在熟悉度,所有这些都涉及 AsiaM。总体而言,我们的结果表明,LLM 更适合被视为外部验证的软因果先验的来源,而不是因果结构的直接证据。