论文
高要基准:评估大语言模型多语言和多文化能力的综合框架
The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
摘要
评估 大语言模型 (LLM) 的多语言和多文化能力对于其全球实用性至关重要。然而,当前的基准面临三个关键局限性:(1)评估维度碎片化,往往忽视了深层的文化差异; (2)依靠低质量的机器翻译,主观任务的语言覆盖率不足; (3) 浅层分析,缺乏简单排名之外的诊断深度。为了解决这些问题,我们推出了GaoYao,这是一个包含 18.23 万个样本、26 种语言和 51 个国家/地区的综合基准测试。首先,高要提出了一个统一的框架,将评估任务分为三个文化层(通用多语言、跨文化、单一文化)和九个认知子层。其次,我们利用专家将主观基准严格本地化为 19 种语言,并综合 34 种文化的跨文化测试集,实现了原生质量扩展,超出了之前的覆盖率高达 111%。第三,我们对20+旗舰级和紧凑型LLM进行了深入的诊断分析。我们的研究结果揭示了显着的地理绩效差异和任务之间的明显差距,为未来的工作提供了可靠的地图。我们发布了基准测试(https://github.com/lunyiliu/GaoYao)。