论文

大语言模型表现出规范性从众

Large Language Models Exhibit Normative Conformity

模型评测模型行为与机制分析

摘要

大语言模型(LLM)表现出的从众偏差,可能给基于LLM的多智能体系统(LLM-MAS)的决策带来重大挑战。以往许多研究仅将“从众”视为观点改变问题,本研究则引入社会心理学中对信息性从众与规范性从众的区分,以便在机制层面理解LLM的从众行为。具体而言,我们设计了新任务来区分两种从众:信息性从众中,讨论参与者有动力做出准确判断;规范性从众中,参与者有动力避免冲突或获得群体接纳。随后我们基于这些任务设定开展实验。实验结果显示,在受测的六个LLM中,最多有五个不仅表现出信息性从众倾向,还表现出规范性从众倾向。此外,有趣的是,我们证明通过操纵社会情境中的细微方面,或许能够控制特定LLM的规范性从众所指向的目标。这些发现表明,LLM-MAS中的决策可能容易受少数恶意用户操纵。另外,通过分析与信息性从众及规范性从众相关的内部向量,我们认为尽管两种行为在外部呈现为同样的“从众”形式,其内部驱动机制却可能各不相同。综合来看,这些结果或可作为理解“规范”如何在LLM中实现及其如何影响群体动态的初步里程碑。

大语言模型表现出规范性从众:论文配图
图1:左为规范性从众、右为信息性从众,示意LLM在社会影响下趋同的两种机制。