论文

人类与大语言模型中的隐性人格表征

Implicit Personality Representations in Humans and LLMs

模型评测模型行为与机制分析

摘要

心理学百年来发现,人们用来描述他人的特质词汇存在差异,但这些特质之间的关系结构——哪些特质相互关联、哪些对立——在不同评分者和文化间高度一致。我们检验大语言模型(Qwen 2.5-7B-Instruct)是否在其内部特质表征中重现这种结构。基于数百万条来自众包平台的虚构人物人格评分,我们构建了涵盖数百个特质的人类隐性人格矩阵;通过对比模型激活,我们构建了相同特质的匹配矩阵。两个关系结构高度一致(Mantel r = 0.77),且在单个特质层面和整体层面均保持一致。模型特质表示中的两个主导维度恢复了长期被认知的人格印象中的社会与智力维度,即社会亲和性与智力能力。在未参与的对话中,将模型激活投影到这些方向上,可生成与人类评分一致的人格画像。本工作建立了一个框架,实现对模型内部特质几何结构与人类人格印象共享结构的全面、基于人类基准的比较。

人类与大语言模型中的隐性人格表征:论文配图
图1:《哈利·波特》中西弗勒斯·斯内普的简化人物档案示例。每项特质尺度由相互对照的词语或短语两极定义并约束,研究共覆盖385项尺度。