论文
识别、模拟和拒绝:大语言模型代理人经典心理效应的污染感知研究
Recognition, Simulation, and Refusal: A Contamination-Aware Study of Classic Psychological Effects in LLM Agents
摘要
产生与人类心理效应相关的反应模式的大语言模型与拥有这种偏见的大语言模型不同。我们提出了 PsyAgentBench,这是一个在 LLM 代理上重新运行经典心理学实验的基准,其构建是为了将这些实验分开:每个范式都使用提示中明确标记的范式(命名)或作为常规任务(盲)运行,并在任务的文字教科书版本(规范)或结构匹配的变体上运行,以减少与可能的训练数据(反事实)的词汇和场景重叠,并与角色操作交叉。在五个完整的范式中,对多达三个开放权重模型系列进行了评估,发布了 41,904 项试验,显然,类人效应是通过性质不同的途径而不是一种敏感性产生的:具有明确覆盖的范式标签门控(Asch 一致性,gpt-oss-120B 上命名的 0% 盲到 83.3%),依赖于知识的信号依赖(锚定,基于事实的精确为零与发明量的接近总数,这种模式同样与理性一致)使用唯一可用的信号)、标签下新颖内容的放大(框架)、稳健缺席(沉没成本)以及安全介导的选择,其中拒绝本身是主要发现(最小组分配)。一句话的人物角色改变(宜人性,被定义为一种指令,而不是经过验证的特质操纵)可以消除、抑制或逆转这些影响,具体取决于它是什么效果,反对任何单一的反应偏差解释。我们进一步形式化了心理学范式无法移植到大语言模型代理人的三种方式,并在两个案例中进行了实证记录:角色主导、群体崩溃和安全选择。我们认为标量偏差敏感性分数掩盖了这种结构,而是报告了复制概况。