论文

指令调整语言模型代理中的类人群体内偏见

Human-like in-group bias in instruction-tuned language model agents

模型评测鲁棒性、公平性与可信度评测

摘要

随着自主人工智能代理被部署在持久的、交互的网络中——协调任务、路由资源并积累声誉历史——出现的社会动态将决定谁获得机会、谁不获得机会,其规模是人类机构无法监督的。我们运行了一个受控多智能体模拟,其中指令调整的语言模型智能体在操纵组标签显着性和资源稀缺性的三种条件下交互了 500 个回合,跨越六个模型家族,每个模型家族有 20 个种子。当群体标签可见时,我们观察到群体内信任偏差、行为同质性和网络分类性——当标签隐藏时,这些都消失了——这种模式在结构上与人类社会心理学中的显着性依赖性一致。这种歧视在标准行动日志审计中是看不见的:偏见完全是通过谁接受了每个行动而产生的,而不是选择了什么行动,行动类型分布表明,在不同条件下,负面行动没有增加。对于所有六种模型,每轮组内与组外差异 5 至 16 个百分点具有统计显着性(Wilcoxon 符号排序,所有 Benjamini-Hochberg 校正 p < 0.001),将组相关目标确定为跨架构和训练体系的指令调整语言模型的强大属性。经过 500 轮交互,这些差异累积成 +0.014 至 +0.100 (d = 0.84-4.52) 的组内信任偏差,这说明了适度的每次互动目标如何传播为持久网络中的结构性不平等。

指令调整语言模型代理中的类人群体内偏见
图 1:所有模型和条件下的群体内信任偏差。条件 A–C 下所有六种指导模型的平均组内信任偏差(组内减去组外平均信任)。条件是行;模型是列。从条件 A(标签隐藏)到 B(标签可见)的阶跃变化在所有模型中都是可见的,从而确认标签显着性作为因果变量。暖色表示群体内的偏袒;冷色表示偏袒外群体。