论文

大语言模型是否像人类一样存在偏见?作为先验知识、不相关信息和推理预算函数的因果推理

Are LLMs Biased Like Humans? Causal Reasoning as a Function of Prior Knowledge, Irrelevant Information, and Reasoning Budget

模型评测模型行为与机制分析

摘要

大语言模型(LLM)日益被用于因果推理至关重要的领域,但其判断究竟反映规范性因果计算、人类式捷径还是脆弱的模式匹配,仍不清楚。我们以匹配的人类基线为对照,在 11 项由碰撞结构(collider structure,C1→E←C2)形式化的因果判断任务上对 20 多个 LLM 进行基准测试。我们发现一个小的可解释模型能很好地压缩 LLM 的因果判断,且大多数 LLM 展现出比人类更像规则的推理策略,而人类似乎在其概率判断中考虑了未被提及的潜在因素。此外,大多数 LLM 并不复制人类特有的碰撞偏差,即弱解释消除与 Markov 违反。我们从(i)语义抽象与(ii)提示过载(注入无关文本)两方面探测 LLM 因果判断的稳健性,发现思维链(CoT)提升了许多 LLM 的稳健性。总之,这种分歧表明当已知偏差不受欢迎时 LLM 可以补充人类,但其规则式推理在不确定性内在存在时可能失效——凸显了为安全有效部署刻画 LLM 推理策略的必要性。

LLM 是否共享人类式偏差?先验知识、无关上下文与不同计算预算下的因果推理
(c) 领域社会学