论文

mmPISA-bench:LLM 在 43 种语言中的推理能力是否同样出色?

mmPISA-bench: Do LLMs Reason Equally Well Across 43 Languages?

模型评测模型能力评测

摘要

我们推出 mmPISA-bench,这是一个源自 OECD 国际学生评估计划 (PISA) 的紧凑型高质量多语言推理基准。该基准由 25 道多项选择题组成,需要推理才能正确回答。每个问题均提供 43 种语言的官方人工翻译,并辅以机器翻译的对应问题(即总共 2,150 个数据点)。我们评估了两种主流专有 LLM 跨语言、推理努力水平和翻译类型的正确回答问题的能力。我们的结果表明,现代 LLM 可以在所有评估的语言中进行有效推理,达到与人类考生相当的准确性,但在所涵盖的语言之间存在一些性能差异。我们进一步发现,相对于官方人工翻译,机器翻译的问题不会降低准确性,这表明高质量的机器翻译(合成数据)通常足以用于无法获得官方翻译的大规模多语言推理评估。最后,我们分析了词元的使用和相关的推理成本,发现在某些语言中 LLM 的使用同时更昂贵且不太准确。