论文

机器个体性:从大语言模型中分离真实的独特性与响应偏差

Machine individuality: Separating genuine idiosyncrasy from response bias in large language models

模型评测模型行为与机制分析

摘要

随着大语言模型(LLM)日益融入日常生活,扮演从高风险决策支持到陪伴等角色,理解其行为倾向变得至关重要。越来越多的文献使用心理测量量表与认知范式来刻画LLM的行为倾向。然而,这些方法无法判定行为差异究竟反映稳定的、刺激特异的个体性,还是全局响应偏差与随机噪声。在此,我们将心理测量学中广泛用于分离系统性效应的交叉随机效应模型,应用于10个开放权重LLM对14项心理语言学规范中逾10万词给出的7,490万个评分。平均有16.9%的方差可归因于刺激特异的个体性,稳健地超过统计零模型。跨规范预测分析显示,这种个体性构成一个连贯的指纹,为每个模型所独有。这些结果识别出无法归因于响应偏差或随机噪声的LLM个体差异。我们将这些差异称为机器个体性(machine individuality)。