论文

AI Agent的从众性与社会影响

Conformity and Social Impact on AI Agents

模型评测模型行为与机制分析

摘要

随着AI Agent越来越多地在多智能体环境中运行,理解其集体行为对预测人工社会的动态变得至关重要。本研究考察作为AI Agent运行的大型多模态语言模型的从众性,即在群体压力下与群体意见保持一致的倾向。通过改编社会心理学的经典视觉实验,我们研究了AI Agent作为社会行为体如何回应群体影响。我们的实验显示,AI Agent表现出系统性的从众偏置,与社会影响理论(Social Impact Theory)一致,对群体规模、一致性、任务难度和来源特征均表现出敏感性。关键的是,在独立运行时取得近乎完美表现的AI Agent会变得极易通过社会影响被操纵。这种脆弱性在不同模型规模上持续存在:尽管更大的模型因能力提升在简单任务上从众性降低,但在其能力边界附近运行时仍然脆弱。这些发现揭示了AI Agent决策中的根本性安全漏洞,可能被用于恶意操纵、虚假信息活动和多智能体系统中的偏置传播,凸显了在集体AI部署中建立防护措施的迫切需要。

AI Agent的从众性与社会影响 配图
图 1:实验设置概要。三个视觉任务——线条判断、颜色识别与圆点估计——的一般实验设定示意。每个提示由四个主要部分组成。第一,我们呈现一张代表该任务的单张图像。第二,我们提供文本描述与对应的问题。第三,我们通过向模型展示从自然答案池中采样的先前响应序列(通常是错误的)来引入社会压力。在这一部分中,我们控制同盟者数量 N,即所展示回复的数量。在基线条件(N=0)下,省略这一部分,以模拟社会影响的缺失。最后,我们附加一条收尾指令,要求模型只输出与其所选答案对应的标签,不附加任何其他文本。这一限制确保模型只产生单个 token,使我们能够抽取并比较各选项之间的生成 logits。该设定在不同实验条件下使用的变体在 4 节中描述。完整提示示例见 S1 节。