论文
不理解的模仿:大语言模型 中决策偏差的起源
Mimicry without understanding: the origins of decision bias in large language models
摘要
大语言模型 (LLM)被发现容易受到一系列社交、情感和认知偏见的影响。我们研究了两种机制,即使人类偏好(在训练数据中)没有偏见或被正确分类为有偏见,也可以通过这两种机制产生这种偏见。第一个是基于人类行为的偏好的错误模仿:这涉及 LLM 推断人类偏好,即使行为在逻辑上与偏好无关。第二个是模仿明显有偏见的人类行为。在四项关注经济偏见的研究中,我们发现 ChatGPT-4o 和 Qwen 表现出社会证明偏见,即使在提示人类行为的报告明显不代表个人的实际偏好时也是如此。当损失厌恶被明确描述为偏见时,LLM 也表现出损失厌恶。事实上,当提示详细的科学报告时,科学报告中的偏差程度(即损失厌恶)预测了 LLM 自己随后的偏差。因此,带有偏见的科学论文可以成为自我实现的预言,至少在涉及 LLM 的回应时是这样。当前的研究不仅充实了 LLM 偏差,还揭示了底层组件过程。