论文
事实还是群体认同:角色智能体的内群体偏好
Truth or Tribe: How In-group Favoritism Prioritize Facts in Persona Agents
摘要
内群体偏爱指优待自己所属群体成员而非外群体成员的现象,在大量社会合作行为中被广泛观察到。近来,生成式语言模型中也被发现了内群体偏爱偏差。然而,当人设智能体面对相互矛盾的信息(如错误信息)时内群体偏爱是否存在,以及如何缓解人设智能体中内群体偏爱偏差的不利影响,这些问题仍研究不足。为解决这些问题,我们提出Truth or Tribe模拟框架,通过三元交互范式研究矛盾信息传播中的智能体合作,并开展受控实验以评估主要调节因素。大量结果表明,人设智能体表现出强烈的内群体偏爱,接受身份相似同伴错误答案的比率远高于身份不同的同伴。在不存在绝对真理的可废止推理情境中,内群体偏爱依然出现,并随认知复杂度增加而加剧。此外,我们提出三种干预策略——身份盲指令(Identity-Blind Instruction)、结构化反事实推理(Structured Counterfactual Reasoning)和异质视角集成(Heterogeneous Perspective Ensemble)——以缓解内群体偏爱。
