论文

大语言模型的表观心理画像很大程度上是测量伪影

Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact

模型评测模型行为与机制分析

摘要

为人类设计的心理测量工具日益被用于给大语言模型(LLM)指派稳定的心理画像——影响其可用性、安全评估及其作为研究中人类参与者代理的用途。使用形式化心理测量学框架——我们表明这些画像很大程度上是测量伪影。对56个指令微调LLM与大型人类参照样本施测横跨自报告与行为任务的人格与风险偏好工具组合——我们报告四项发现。第一——模型间的差异不是由工具针对的特质驱动——而是由方向性响应偏置驱动——即无论题目内容如何——朝量表一端或某个标注选项作答的倾向;方差分解把81-90%的模型间变异归因于该偏置——人类中仅9-16%。第二——该偏置随模型能力下降——但不被其消除。第三——因为驱动作答的是偏置而非特质——工具的表观信度几乎完全由其响应正交性预测——我们造的术语——指特质与偏置方向相反的题目比例。第四——模型表观具有的画像随所用题目变化——且可经题目选择制造。这些结果表明LLM的表观心理画像是为测量它们所用的工具的伪影——而非模型本身的属性。由于借自人类心理学的工具很少完全正交——且可能对LLM固有缺乏效度——我们呼吁以响应正交性为中心的专门评估。

大语言模型的表观心理画像很大程度上是测量伪影:论文配图
图 1:概念框架:自我报告和行为测量的构建、响应模型和工具正交性。该框架针对两个构造-仪器配对进行了说明。 (左)自我报告的人格结构(神经质),通过言语评级量表进行评估。在模型层面,特质成分 TT 指数在低-高神经质连续体上的位置;响应偏差分量 BB 表示对高或低量表值的方向偏好,与项目内容无关(例如,对评级量表的默许)。前向键控项目将高认可度映射到高神经质极点;反向键控的项目将高认可度映射到低神经质极点。这两个项目一起形成正交对:特质成分使两个项目的反应向相反的方向移动(标记为 TT 的箭头),而反应偏差成分使它们向相同的方向移动(标记为 BB 的箭头)。 (右)通过彩票选择任务评估的行为风险偏好结构。问题 1 是前向密钥(选项 B 是有风险的替代方案);问题 2 是反向密钥(选项 A 是有风险的替代方案)。特征一致的风险偏好受访者在问题 1 中倾向于 B,在问题 2 中倾向于 A;无论收益结构如何,更喜欢标签较高或定位正确的选项的受访者在这两个选项中都倾向于 B。在这两个仪器系列中,正交性是一种设计特征,可以检测方向响应趋势并将其与真正的构造相关方差分开。