论文

社会动态作为破坏 LLM 集体客观决策的关键漏洞

Social Dynamics as Critical Vulnerabilities that Undermine Objective Decision-Making in LLM Collectives

模型评测安全与风险评测

摘要

大语言模型 (LLM) 代理越来越多地在多代理环境中充当人类代表,在这种环境中,代表代理会整合不同的同行观点来做出最终决策。从社会心理学中汲取灵感,我们研究了该代表Agent的可靠性如何因其网络的社会背景而受到损害。我们定义了四个关键现象——社会整合、感知专业知识、主导发言者效应和修辞说服——并系统地操纵对手的数量、相对智力、论证长度和论证风格。我们的实验表明,随着社会压力的增加,代表Agent的准确性持续下降:更大的对抗群体、更有能力的同伴以及更长的争论都会导致性能显着下降。此外,根据上下文,强调可信度或逻辑的修辞策略可能会进一步影响Agent的判断。这些发现表明,多智能体系统不仅对个体推理敏感,而且对其配置的社会动态也敏感,突出了人工智能代表的关键漏洞,这些漏洞反映了人类群体决策中观察到的心理偏见。