论文
教训无国界?使用多语言故事道德生成评估 LLM 的文化一致性
Lessons Without Borders? Evaluating Cultural Alignment of LLMs Using Multilingual Story Moral Generation
摘要
故事是跨文化传播价值观的关键,但它们的解释因语言和文化背景而异。因此,我们引入多语言故事道德生成作为一项新颖的基于文化的评估任务。使用跨 14 个语言文化对收集的人类编写的故事道德的新数据集,我们通过语义相似性、人类偏好调查和价值分类,将模型输出与人类解释进行比较。我们表明,GPT-4o 和 Gemini 等前沿模型生成的故事道德在语义上与人类反应相似,并且受到人类评估者的青睐。然而,他们的输出表现出明显较少的跨语言差异,并且集中于范围较窄的广泛共享的价值观。这些发现表明,虽然当代模型可以近似人类道德解释的中心趋势,但它们很难再现人类叙事理解的多样性特征。通过将叙事解释视为一项评估任务,这项工作引入了一种新方法来研究语言模型中的文化一致性,超越静态基准或基于知识的测试。