论文
大语言模型中的人格条件化风险行为:基于GPT-4.1的模拟赌博研究
Persona-Conditioned Risk Behavior in Large Language Models: A Simulated Gambling Study with GPT-4.1
摘要
大语言模型(LLM)正日益被部署为自主智能体,用于不确定的序贯决策情境。然而,它们在此类环境中表现出的行为究竟反映了有原则的认知模式,还是仅仅是对提示的表面模仿,目前仍知之甚少。本文提出一项受控实验:为GPT-4.1分配三种社会经济人格之一(Rich、Middle-income和Poor),并将其置于一个结构化老虎机环境中,该环境包含三种不同的机器配置:Fair(50%)、Biased Low(35%)和Streak(连续失败后动态上升的概率)。在每种条件50次独立迭代、共记录6,950次决策的实验中,我们发现该模型在未被指示的情况下复现了Kahneman和Tversky前景理论(Prospect Theory)所预测的关键行为特征。Poor人格每局平均玩37.4轮(SD=15.5),而Rich人格仅为1.1轮(SD=0.31),差异高度显著(Kruskal-Wallis H=393.5,p<2.2e-16)。各人格的风险评分显示出很大的效应量(Poor与Rich之间Cohen's d=4.15)。情绪标签似乎只起事后标注的作用,而非决策驱动因素(chi-square=3205.4,Cramer's V=0.39),且跨轮次的信念更新可忽略不计(Poor人格的Spearman rho=0.032,p=0.016)。这些发现对LLM智能体设计、可解释性研究,以及经典认知经济偏差是否被隐式编码于大规模预训练语言模型之中这一更宏大的问题,都具有重要意义。
