论文

事实还是群体认同:角色智能体的内群体偏好

Truth or Tribe: How In-group Favoritism Prioritize Facts in Persona Agents

模型评测鲁棒性、公平性与可信度评测

摘要

内群体偏爱指优待自己所属群体成员而非外群体成员的现象,在大量社会合作行为中被广泛观察到。近来,生成式语言模型中也被发现了内群体偏爱偏差。然而,当人设智能体面对相互矛盾的信息(如错误信息)时内群体偏爱是否存在,以及如何缓解人设智能体中内群体偏爱偏差的不利影响,这些问题仍研究不足。为解决这些问题,我们提出Truth or Tribe模拟框架,通过三元交互范式研究矛盾信息传播中的智能体合作,并开展受控实验以评估主要调节因素。大量结果表明,人设智能体表现出强烈的内群体偏爱,接受身份相似同伴错误答案的比率远高于身份不同的同伴。在不存在绝对真理的可废止推理情境中,内群体偏爱依然出现,并随认知复杂度增加而加剧。此外,我们提出三种干预策略——身份盲指令(Identity-Blind Instruction)、结构化反事实推理(Structured Counterfactual Reasoning)和异质视角集成(Heterogeneous Perspective Ensemble)——以缓解内群体偏爱。

Truth or Tribe:内群体偏爱如何左右人设智能体对事实的取舍:论文配图
图 1:LLM 代理人中群体内偏袒的说明。三元交互范式演示了主体代理 (ASA_{S}) 如何面对来自角色相似度高的组内同伴 (Ai​nA_{in}) 和角色相似度低的组外同伴 (Ao​u​tA_{out}) 的冲突信息。