论文
谁的规范? 大语言模型 中解开文化和个人一致性
Whose Norms? Disentangling Cultural and Personal Alignment in Large Language Models
摘要
大语言模型 越来越多地用于需要平衡文化规范与个人偏好的社会决策情况。例如,当当地规范倾向于间接反馈时,喜欢诚实的用户可能会询问是否公开纠正同事。然而,现有的研究很大程度上是分开研究文化一致性和个性化的。我们引入了 PACT,即个人偏好和文化规范权衡框架,该框架评估模型是选择遵循文化规范还是允许个人偏好。我们发现,LLM 在执行文化规范的严格程度方面有所不同,行为随国家背景 (7.8%) 的变化大于年龄 (1%) 和性别 (0.7%),并且在指令调整后变化不均匀。此外,我们对 PACT 的五国人类研究表明,人类的文化追随主要是由情景国家驱动的,当参与者判断自己的文化背景时,一致性最低,表现出文化内的多元化。最后,人类-LLM 对齐实验表明,模型可以匹配大多数选择,但无法捕获响应分布和不确定性(最佳相关性仅达到 0.24)。总之,这些发现激发了超越多数的一致性评估,以捕捉文化多元化和社会判断中的分歧。