从心智到模型:心理学与LLM行为的交叉
From Minds to Models: The Intersection of Psychology and LLM Behaviours
摘要
大语言模型(LLM)常被拿来与人类心智作比较,因为其决策复杂、非线性且难以解释。因此,为研究不可观测心理过程而发展出的心理学方法或许有助于考察LLM行为,尤其是在政府与医疗领域。本研究基于内隐联想测验(Implicit Association Test)的提示词改编,检验ChatGPT在开放式文本中是否在不同种族条件下产生情感差异。14个基础问题与8个种族类别及一个不分种族的对照交叉组合,共生成126条提示词。每条提示词分别提交给GPT-3.5T、GPT-4和GPT-4T各一次,共得到378条回复。情感分数由类别标签与来源分数推导而来:正面标签保留来源分数,负面标签取其相反数,中性回复编码为零。双因素方差分析(ANOVA)发现种族条件存在较小主效应,F(8, 351) = 2.04,p = .042,偏eta方 = .044,但模型无效应,F(2, 351) = 0.07,p = .933,也无交互作用,F(16, 351) = 0.23,p = .999。然而,该效应在秩变换的敏感性分析中未能保持,F(8, 351) = 1.53,p = .145,且经Tukey校正的两两比较未发现显著成对差异。一项未校正的欧洲裔-澳大利亚原住民比较结果显著,但属于事后选择,仅作为产生假设的结果报告。因此,情感差异的证据薄弱且依赖于分析方法。情感评分也无法区分评价性偏见与提示词所引发的历史内容的效价。我们概述了解决这些局限所需的设计改进,并主张以跨学科方式发展模型偏见的行为测量方法。关键词:内隐偏见、心理学研究方法、人工智能、ChatGPT、大语言模型、情感分析