论文

说服与顺从倾向可预测人类和语言模型的群体决策

Persuasive and Compliant Tendencies Predict Group Decision-Making in Humans and Language Models

模型评测模型行为与机制分析

摘要

大语言模型(LLM)日益参与与其他LLM及人类的群体决策。但其影响力究竟由说服导向的表达还是顺从导向的迎合所驱动,仍不清楚。我们提出DecisionQE,一个基于问卷的框架,用于测量各模型在多个决策场景中的说服与顺从倾向,并以狼人杀游戏为交互试验场,研究这些倾向在不对称信息下对社会影响和群体结果的影响。各实验显示,更强的说服倾向并未显著改善群体结果,而顺从导向的模型在合作中表现出更稳定的优势。我们进一步揭示顺从的双重效应:它在诚实角色中支持合作,却提升对抗角色中的隐瞒能力。这些发现表明,LLM群体交互不仅揭示任务结果,还揭示可测量的内在行为倾向模式。因此LLM可作为观察语言中介互动的社会学透镜,同时提示需要将行为倾向纳入LLM系统的安全评估。

说服与顺从倾向可预测人类和语言模型的群体决策:论文配图
图1:评估框架。a. DecisionQE构建,评估六个决策相关领域的说服与合规倾向:公共沟通、日常决策、营销与说服、展示与表达、人际沟通以及谈判与策略互动。b. Werewolf流程。候选LLM被分配四种角色:狼人、村民、预言家和女巫。狼人知晓队友并选择夜间目标;村民依靠讨论与投票;预言家每晚查验一名幸存玩家;女巫拥有一瓶解药和一瓶毒药。该设置将DecisionQE测得的倾向特征与交互动态及群体层面结果联系起来。