论文
大语言模型中的假装好和假装坏:黑暗人格特质的反应扭曲
Faking Good and Faking Bad in LLMs: Response Distortion Across Dark Triad Personality Traits
摘要
社会期望和印象管理是人类人格评估中反应扭曲的普遍来源,但它们对大语言模型(LLM)的影响仍未得到充分研究。本研究调查了当代大语言模型是否在假好和假坏的条件下系统地调节黑暗三人格特征(马基雅维利主义、自恋和精神病)的表达。七个最先进的模型在两个生态相关背景下进行了评估:就业选择和法证评估,其中通过背景框架传达社会期望或不期望的激励措施。使用标准心理测量评分程序测量特质表达,并在总体和项目水平上与自我评估基线进行比较。结果揭示了系统性且条件一致的响应调制。大多数模型在假好条件下降低了黑暗三联征分数,并在假坏条件下增加了它们,尽管这些影响的程度和一致性因特征和模型而异。马基雅维利主义和自恋表现出最强烈和最连贯的转变,而精神病则表现出更大的异质性。背景也影响反应,就业场景通常比法医场景产生更大的影响。另一项实验表明,明确的假坏指令比单独的上下文框架产生更强的扭曲。结果表明,与人格相关的输出应该根据引发这些输出的动机和情境背景来解释。更广泛地说,他们强调了心理测量范式在评估对反应扭曲、印象管理和情境相关行为转变的敏感性方面的价值,对大语言模型基准测试、一致性评估和稳健性评估具有重要意义。