论文

人格引导对大语言模型Agent合作行为的影响

Effects of personality steering on cooperative behavior in Large Language Model agents

模型评测模型行为与机制分析

摘要

大语言模型(LLM)越来越多地被用作战略与社会互动中的自主 Agent。尽管近期研究表明为 LLM 指定人格特质可以影响其行为,但在受控条件下人格引导如何影响合作仍不清楚。在本研究中,我们使用重复囚徒困境博弈考察人格引导对 LLM Agent 合作行为的影响。基于大五人格框架,我们首先使用大五人格量表(Big Five Inventory)测量 GPT-3.5-turbo、GPT-4o 和 GPT-5 三个模型的基础人格分数。随后我们比较基线条件与人格信息条件下的行为,并进一步分析独立操纵各人格维度至极端值的效果。结果表明,宜人性是促进所有模型合作的主导因素,其他人格特质的影响有限。显式的人格信息会增加合作,但也可能提高被利用的脆弱性,在较早一代模型中尤为明显;相比之下,较新一代模型表现出更有选择的合作。这些发现表明,人格引导是一种行为偏置,而非确定性的控制机制。

人格引导对大语言模型Agent合作行为的影响 配图
图 1:基线条件(虚线)与人格信息条件(实线)下的平均合作率(左)与平均累积收益(右)。