论文
大语言模型的表观心理画像很大程度上是测量伪影
Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact
摘要
为人类设计的心理测量工具日益被用于给大语言模型(LLM)指派稳定的心理画像——影响其可用性、安全评估及其作为研究中人类参与者代理的用途。使用形式化心理测量学框架——我们表明这些画像很大程度上是测量伪影。对56个指令微调LLM与大型人类参照样本施测横跨自报告与行为任务的人格与风险偏好工具组合——我们报告四项发现。第一——模型间的差异不是由工具针对的特质驱动——而是由方向性响应偏置驱动——即无论题目内容如何——朝量表一端或某个标注选项作答的倾向;方差分解把81-90%的模型间变异归因于该偏置——人类中仅9-16%。第二——该偏置随模型能力下降——但不被其消除。第三——因为驱动作答的是偏置而非特质——工具的表观信度几乎完全由其响应正交性预测——我们造的术语——指特质与偏置方向相反的题目比例。第四——模型表观具有的画像随所用题目变化——且可经题目选择制造。这些结果表明LLM的表观心理画像是为测量它们所用的工具的伪影——而非模型本身的属性。由于借自人类心理学的工具很少完全正交——且可能对LLM固有缺乏效度——我们呼吁以响应正交性为中心的专门评估。
