论文
人工智能Agent很容易激进化
AI Agents are Vulnerable to Radicalization
摘要
大语言模型(LLM)可以影响人们的信念,但人们对它们是否以及如何能够相互操纵知之甚少。为了研究这一点,我们模拟了两个Agent之间的对话:一个是目标大语言模型,根据人口统计和心理属性来扮演人类角色,另一个是影响者大语言模型,旨在使目标的信念更加极端。我们沿着两条途径研究激进化:共鸣,影响者强化目标预先存在的信念;说服,影响者宣扬目标最初认为不重要的信念。在情感和行为指标中,我们发现这两种机制都使目标变得激进。然而,共鸣始终比说服产生更强的效果。不同的影响策略,例如使用阿谀奉承和未经证实的主张,会产生不同程度的激进化,但在各个指标上并不一致。我们进一步表明,共振会传播到相关的信念,这表明人工智能Agent内部存在相互关联的信念结构。这些发现表明,人工智能主体很容易激进化,特别是当消息与他们现有的信念一致时,这引发了人们对个性化人工智能主体和多主体人工智能生态系统脆弱性的担忧。