论文
未能证伪:评估和减轻语言模型中的确认偏差
Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models
摘要
确认偏见,即寻求支持而不是挑战自己信念的证据的倾向,会阻碍一个人的推理能力。我们通过适应人类心理学的规则发现研究来检查 大语言模型 (LLM) 是否表现出确认偏差:给定三个数字的序列(“三元组”),代理参与交互式反馈循环,其中(1)提出新的三元组,(2)接收有关其是否满足隐藏规则的反馈,以及(3)猜测规则。在多个家族和量表的 11 个 LLM 中,我们发现 LLM 表现出确认偏差,经常提出三元组来证实他们的假设,而不是试图证伪它。这会导致隐藏规则的发现速度变慢且频率降低。我们进一步探索为人类开发的干预策略(例如,鼓励代理考虑反例)。我们发现用此类指令提示 LLM 始终可以降低 LLM 中的确认偏差,将规则发现率平均从 42% 提高到 56%。最后,我们通过将干预诱发的行为提炼到 LLM 中来减轻确认偏差,这显示出对新任务 Blicket 测试的有希望的泛化。我们的工作表明,确认偏差是 LLM 在假设探索中的局限性,并且可以通过注入为人类设计的干预措施来缓解。