论文
快思考,错思考:直觉性调节LLM在政策评估中的反事实推理
Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation
摘要
大语言模型(LLM)越来越多地用于因果推理和反事实推理,但它们在现实世界政策评估中的可靠性仍未得到充分探索。我们构建了 40 个来自经济学和社会科学的实证政策评估案例的基准,每个案例都基于同行评审的证据,并按直觉进行分类——实证结果是否与(显而易见的)、相对不清楚(模棱两可的)或与(反直觉的)普遍的先前预期相一致。我们通过 2,400 项实验试验评估了五种激励策略中的四位前沿大语言模型,并使用混合效应逻辑回归分析结果。我们的研究结果揭示了三个关键结果:(1)思维链(CoT)悖论,其中思维链提示可以显着提高明显案例的表现,但这种好处在反直觉案例中几乎被消除(交互 OR = 0.053,$p < 0.001$); (2)直观性为主导因素,比模型选择或提示策略解释更多的方差(ICC = 0.537); (3) 知识推理分离,其中基于引用的熟悉度与准确性无关 ($p = 0.53$),这表明模型拥有相关知识,但当发现与直觉相矛盾时无法用它进行推理。我们通过双过程理论(系统 1 与系统 2)的视角来构建这些结果,并认为当前大语言模型的“思维迟缓”可能只不过是“说话缓慢”——他们产生的是深思熟虑的推理形式,但没有实质内容。
