论文

没有文化自我的文化偏见:LLM角色与偏见的分离研究

Cultural Bias Without a Cultural Self:A Disassociation Study of LLM's Persona and Bias

模型评测模型行为与机制分析

摘要

在跨文化研究中,由文化角色提示的语言模型越来越多地代表人类受访者。他们的反应将人物角色清晰地分开,而这种分离被解读为文化观点的证据。我们证明这种分离是真实的,而观点却不是,并且有一个标准可以区分它们。特质是一个受访者的内部结构,在测量框架发生变化后仍然存在;偏差只需要特定于组的项目平均值。为了测试第一个,我们将单个响应集表示为题项—维度矩阵,并将其相关矩阵视为对称正定矩阵流形上的一个点。在人类中,这具有应有的特征:它在测试-再测试会话中重现,不共享任何项目、顺序或上下文($r=0.77$,$N=89$);根据公开的 NEO-PI-R 数据,它可以识别出高达 $76\%$ 的个人,而机会水平为 $0.4\%$ ($N=263$);它预测 GPA ($R^2=0.281$, $p=0.003$),而 BigFive 从相同的响应中聚合得出的结果没有预测任何结果 ($R^2=0.018$)。在四个前沿 LLM 中它什么也不返回。仅当每个实例共享一个项目顺序时,角色结构才可读:给每个实例提供自己的顺序,并且分离度从94.7%降至随机水平,而将实例重新对齐到 \emph{any} 共享随机顺序会将其恢复到 $82$--$84\%$。逐项独立生成的响应,没有潜在结构,再现了整个模式。文化信号是一个群体模板,而不是任何实例的属性,并且排列机制的不同仅在于表面上存在的刻板印象。