论文
AI Agent的从众性与社会影响
Conformity and Social Impact on AI Agents
摘要
随着AI Agent越来越多地在多智能体环境中运行,理解其集体行为对预测人工社会的动态变得至关重要。本研究考察作为AI Agent运行的大型多模态语言模型的从众性,即在群体压力下与群体意见保持一致的倾向。通过改编社会心理学的经典视觉实验,我们研究了AI Agent作为社会行为体如何回应群体影响。我们的实验显示,AI Agent表现出系统性的从众偏置,与社会影响理论(Social Impact Theory)一致,对群体规模、一致性、任务难度和来源特征均表现出敏感性。关键的是,在独立运行时取得近乎完美表现的AI Agent会变得极易通过社会影响被操纵。这种脆弱性在不同模型规模上持续存在:尽管更大的模型因能力提升在简单任务上从众性降低,但在其能力边界附近运行时仍然脆弱。这些发现揭示了AI Agent决策中的根本性安全漏洞,可能被用于恶意操纵、虚假信息活动和多智能体系统中的偏置传播,凸显了在集体AI部署中建立防护措施的迫切需要。
