论文
CulturALL:真实情境下的大模型多语言与多文化能力评测
CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks
摘要
大语言模型 (LLM) 现已在全球范围内部署,激发了一系列衡量其多语言和多文化能力的基准。然而,这些基准优先考虑通用语言理解或肤浅的文化琐事,而对真实情境任务的评估(模型必须在现实世界、上下文丰富的场景中进行推理)基本上没有得到解决。为了填补这一空白,我们推出了 CulturALL,这是一个全面且具有挑战性的基准,用于评估 LLM 在真实情境任务上的多语言和多文化能力。 CulturALL 是通过人与人工智能协作框架构建的:专家注释者确保适当的难度和事实准确性,而 LLM 则减轻了手动工作量。通过整合多元来源,CulturALL确保全面的场景覆盖。每个项目都经过精心设计,呈现出高难度,使 CulturALL 具有挑战性。 CulturALL 包含来自 51 个地区、14 种语言的 2,610 个样本,分布在 16 个主题中,以捕获全面的扎根任务。实验表明,最好的 LLM 在 CulturALL 上达到了 44.48% 的准确率,这凸显了巨大的改进空间。