论文
LLM相信自己:多Agent系统中身份相关的一致性
LLMs Trust Their Own: Identity-Dependent Conformity in Multi-Agent Systems
摘要
大语言模型 (LLM) 越来越多地部署在多智能体环境中,智能体相互观察并影响彼此,使社会影响成为人工智能行为和安全的一个关键维度。我们调查LLM的反应是否取决于其他Agent的社会身份,超出了他们共识的影响。我们用单个正确答案构建判断任务,并将模型放置在多智能体环境中,在该环境中,模型从其他智能体那里收到不正确的答案,这些智能体的社会身份(人工智能或人类、模型家庭或任意最小群体)要么与自己相同,要么不同。在 12 个开放权重模型和 9 个任务中,我们发现群体认同对错误答案的遵从性有双向影响:群体内共识会增加遵从性(群体内偏袒),而群体外共识会降低群体认同(群体外分歧)。与人类不同的是,对于人类来说,一个盟友打破共识会大大降低从众性,而模型则不会被来自多数群体的盟友所感动。更糟糕的是,来自敌对群体的正确盟友会加剧这种双向效应。思维链推理抑制了大部分影响,但群体内的盟友仍然会减少对不正确的群体外多数的顺从。将同伴标记为安全一致会改变整体一致性,但不会影响群体内的偏袒和群体外的分歧。这些结果表明,群体身份决定了LLM如何跨Agent聚合信息(无论其正确性如何),并确定多Agent工智能系统的操作界面。