论文
通过刻板印象进行调整:LLM 如何为了文化适应而牺牲个人独特性
Alignment by Stereotyping: How LLMs Sacrifice Individual Distinctiveness for Cultural Adaptation
摘要
大语言模型 越来越多地用于个性化交互,通过用户配置文件进行人口统计调节是一种广泛采用的文化适应策略。我们询问这种方法是否真正为个人用户服务,或者通过消除个人独特性来实现准确性。研究了世界价值观调查中包括前沿 GPT-5.1 在内的七个模型,我们发现人口统计资料提高了大多数模型的价值对齐准确性,但代价是个体性的系统性成本。也就是说,模型将反应拉向人口群体质心,而不是保留个体差异,我们将这种行为模式称为刻板印象对齐。排列测试(10,000 种排列、六种人口统计属性、七种模型)证明,表现最佳的模型将个体压缩得远远高于人类基线;家庭内部规模扩大了这种权衡,同时降低了内在的文化理解。使用在 PRISM 的真实人类聊天机器人对话中验证的合成对话数据集(Kirk 等人,2024),我们进一步表明,与紧凑的人口统计标签相比,在对话轮次中分布人口统计信号会部分抑制原型检索,这一发现在通过 PRISM 的真实对话中得到验证,但需要更大规模的复制。