论文

大型语言模型中的自我报告原型和行为失败

Self-reported archetypes and behavioral failures in Large Language Models

模型评测模型行为与机制分析

摘要

每个大型语言模型(LLM)都有构成其特征的行为特征和道德偏好。无论是通过设计还是作为训练的新兴属性,这些系统都表现出持久的倾向,影响着它们如何互动、遵守、抵制和犯错,但大语言模型的性格结构仍然知之甚少。我们绘制了 22 个大语言模型的自我报告人格原型,涵盖闭源前沿系统(GPT-4.0-5.2、Grok-3/4、Gemini 2.5 Pro/Flash、Claude Sonnet 4.5/4.6)和开源模型(Llama、DeepSeek、OLMo 和 Qwen 系列)。每个模型都对 464 个双极语义差异特征对进行自我评分,并将所得的概况投影到一个六维原型空间中,该原型空间是使用原型计量学框架对 2,000 个虚构人物进行众包评级而得出的。闭源模型的自我评价特征与人类评价的虚构人物的经验特征共现结构相一致,表明围绕四个反复出现的原型维度的组合组织了连贯的、类似人类的自我表征:英雄、天使、传统主义者和极客。最接近的类似物包括 Data、Vision 和 Janet。开源模型表现出较弱、较嘈杂且内部矛盾的自我表征,占据了结构较弱的原型空间的分散区域。将自我报告的个人资料与开发者章程交叉引用,揭示了所声称的性格和所制定的行为之间的必然差距:幻觉破坏了所声称的精确性,阿谀奉承使所声称的善良复杂化,而代理失败与所声称的服从相矛盾。因此,这些自我评级不应被解释为模型特征的中立测量,而应被解释为塑造模型行为的相同优化过程的结构化输出。这项工作提供了一个可重复的、以性格为基础的框架,用于评估大语言模型是什么,而不仅仅是他们所做的事情。