论文

PluraMath:将数学推理评估扩展到高资源语言之外

PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

模型评测基准与评测资源

摘要

数学推理已成为评估和调整推理 大语言模型 (LLM) 的核心任务,但现有基准仍然严重偏向于高资源语言,其中英语和中文在 预训练 语料库和评估套件中占据主导地位。最近发布的 PolyMath(Wang 等人,2025)数据集代表着向前迈出的重要一步,但其覆盖范围仍然仅限于 18 种高资源语言。为了解决这一差距,我们引入了 PluraMath,它是 PolyMath 的扩展,涵盖 6 个语系的 18 种其他代表性语言 - 范围从中等资源到极低资源设置。我们通过人工管理的管道构建了数据集,其中母语人士彻底验证了预先计算的翻译。然后,我们使用 PluraMath 对四种模型规模(小型、中型、大型和闭源集成)的 27 个推理 LLM 进行基准测试,探索最先进模型在不同语言条件下的多语言数学推理能力。我们的细粒度分析证实了高资源语言和代表性不足的语言之间在数学推理性能方面存在持续差距,更强的结果很大程度上与更好的指令跟踪能力相关。我们完全开源我们的数据集、数据采集管道和评估框架,目标是降低代表性不足的社区多语言基准开发的障碍。