论文

快思考,错思考:直觉性调节LLM在政策评估中的反事实推理

Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation

模型评测模型能力评测

摘要

大语言模型(LLM)越来越多地用于因果推理和反事实推理,但它们在现实世界政策评估中的可靠性仍未得到充分探索。我们构建了 40 个来自经济学和社会科学的实证政策评估案例的基准,每个案例都基于同行评审的证据,并按直觉进行分类——实证结果是否与(显而易见的)、相对不清楚(模棱两可的)或与(反直觉的)普遍的先前预期相一致。我们通过 2,400 项实验试验评估了五种激励策略中的四位前沿大语言模型,并使用混合效应逻辑回归分析结果。我们的研究结果揭示了三个关键结果:(1)思维链(CoT)悖论,其中思维链提示可以显着提高明显案例的表现,但这种好处在反直觉案例中几乎被消除(交互 OR = 0.053,$p < 0.001$); (2)直观性为主导因素,比模型选择或提示策略解释更多的方差(ICC = 0.537); (3) 知识推理分离,其中基于引用的熟悉度与准确性无关 ($p = 0.53$),这表明模型拥有相关知识,但当发现与直觉相矛盾时无法用它进行推理。我们通过双过程理论(系统 1 与系统 2)的视角来构建这些结果,并认为当前大语言模型的“思维迟缓”可能只不过是“说话缓慢”——他们产生的是深思熟虑的推理形式,但没有实质内容。

快思考,错思考:直觉性调节LLM在政策评估中的反事实推理
图 1:CoT 悖论:准确性从朴素到按直观类别提示的 CoT 变化(仅限两侧案例)。在明显的情况下,CoT 将准确度提高了 17 个百分点,但在反直觉的情况下,准确率仅提高了 4 个百分点,这一差距是由 CoT 强化而不是超越直觉先验造成的。