论文

文化真实性:将 LLM 文化表征与本土人类期望进行比较

Cultural Authenticity: Comparing LLM Cultural Representations to Native Human Expectations

模型评测评测方法与指标

摘要

大语言模型 (LLM) 输出中的文化代表性主要通过文化多样性和事实准确性的代理进行评估。然而,在评估文化一致性方面仍然存在一个关键差距:生成的内容在多大程度上反映了原住民如何看待和优先考虑自己的文化方面。在本文中,我们引入了一个以人为本的框架来评估 LLM 代与当地期望的一致性。首先,我们建立了一个源自人类的 真值 重要向量基线,称为文化重要性向量,基于从九个国家收集的开放式调查响应中归纳出的一组具有文化意义的重要方面。接下来,我们介绍一种基于句法多样化提示集计算 LLM 的模型衍生文化表示向量的方法,并将其应用于三个前沿 LLM(Gemini 2.5 Pro、GPT-4o 和 Claude 3.5 Haiku)。我们对源自人类的文化重要性和源自模型的文化表征之间的一致性的调查揭示了一些模型的以西方为中心的校准,其中随着一个国家与美国的文化距离的增加,一致性会降低。此外,我们在所有模型中识别出高度相关的系统性错误特征($ρ> 0.97$),这些错误特征过度索引了某些文化标记,同时忽略了根深蒂固的社会和基于价值的用户优先级。我们的方法超越了简单的多样性指标,转向评估人工智能生成内容的保真度,真实捕捉全球文化的微妙层次结构。