论文

用GPT对话智能体模拟总体人类选择行为与偏差

Emulating Aggregate Human Choice Behavior and Biases with GPT Conversational Agents

模型评测模型行为与机制分析

摘要

认知偏差常常塑造人类决策。虽然大语言模型(LLM)已被证明能重现著名偏差,但一个更关键的问题是:LLM能否在个体层面预测偏差,并在认知负荷等情境因素与这些偏差交互时模拟带偏差的人类行为动态。我们将三个成熟的决策情境改编为对话式场景,并开展了人类实验(N=1100)。参与者与一个通过简单或复杂对话辅助决策的聊天机器人互动。结果揭示出稳健的偏差。为评估LLM如何在类似交互条件下模拟人类决策,我们使用参与者的人口统计学信息和对话记录,用基于GPT-4和GPT-5的LLM来模拟这些条件。这些LLM精确重现了人类偏差。我们发现不同模型在对齐人类行为的方式上存在显著差异。这对在交互情境中设计和评估自适应的、偏差感知的基于LLM的AI系统具有重要意义。

用GPT对话智能体模拟总体人类选择行为与偏差
图4。Status quo:响应长度(字符)与响应时间(秒)之间的相关性。粗线是回归线。虚线是人类平均打字速度(每分钟260个字符)。该图展示了Status Quo条件下响应长度(以字符计)与响应时间(以秒计)关系的散点图。每个点代表一名参与者的响应。图中包含一条粗橙色回归线,表示观察到的响应长度与响应时间之间的关系,以及一条红色虚线,表示作为参照的人类平均打字速度(每分钟260个字符)。横轴标注响应时间,纵轴标注响应长度。