论文
类人道德判断在大型语言模型中隐藏了不同的动机归因
Human-like moral judgments conceal divergent motive attributions in large language models
摘要
大型语言模型 (LLM) 用于模拟心理学研究中的人类参与者。我们询问,重现人类对举报人道德品质评价的大语言模型是否也重现了伴随他们的动机归因。五名大语言模型和两名人类样本(N = 125 和 N = 742)对一名医生进行了评估,该医生要么对欺诈性账单保持沉默,要么向医院、监管机构或报纸举报。模型再现了医生道德品质的人类排名,但将举报人描绘成更乐于助人、更少自私、更少敌意。在五个模型中的四个中,竞争动机与道德品质判断的相关性不太强。当提示重现两个人类样本的叙述和人口统计概况时,模型评分几乎没有变化,尽管这种比较不能隔离视角效应。因此,平均评级的一致性可以掩盖归因动机、判断之间的关系以及对环境的敏感性方面的差异。因此,验证大语言模型作为模拟参与者需要测试心理信息反应模式,而不仅仅是平均一致性。