论文
声誉、策略和情感对生成式人工智能合作的影响:推理与非推理模型的比较
Reputation, Strategy, and Emotion Effects on Generative AI Cooperation: A Comparison Across Reasoning and Non-Reasoning Models
摘要
随着生成式人工智能 (Gen AI) 系统在经济和社会影响力的互动中发挥越来越自主的作用,了解它们的合作倾向以及塑造这种倾向的信号变得至关重要。我们使用迭代囚徒困境、操纵对方声誉(正面、未知、负面)、策略(勒索与慷慨)和非语言情感信号(传达竞争或合作评价的面部表情)来检查前沿人工智能模型中的合作行为。在第一项使用非推理模型(Claude 3.5、Gemini 2.0 Flash、GPT-4o)的研究中,合作是由所有三个因素系统地塑造的,与人类行为研究中长期记录的模式相似,尽管模型在每个因素的权重方面存在很大差异。第二项推理模型研究(Claude 4.6、Gemini 3、GPT-5.2)揭示了对策略和声誉的更加集中的依赖,在非推理模型中观察到的波将金效应几乎被消除(诊断和谐游戏中近乎一致的合作证明了这一点),并且情绪的条件性作用与分层线索加权策略一致,而不是简单地丧失社会敏感性。推理模型还显示了异构的最终游戏行为,从持续合作到系统性的最后一轮背叛效应,揭示了特定于模型的可利用性概况,与谈判和其他多轮交互中的部署具有直接的实际相关性。总之,这些发现将 Gen AI 模型描述为日益复杂但异构的社会参与者,并强调了开发标准化合作基准的实际价值,以告知 Gen AI 在交互式、具有社会影响力的环境中负责任的部署。