论文

MathNet:面向数学推理与检索的全球多模态基准

MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

模型评测基准与评测资源

摘要

数学问题求解仍然是对大语言模型和多模态模型推理能力的严峻考验,然而现有基准在规模、语言覆盖和任务多样性上均有限。我们提出MathNet,一个高质量、大规模、多模态、多语言的奥赛级数学问题数据集,以及一个用于评估生成式模型数学推理和嵌入系统数学检索的基准。MathNet横跨47个国家、17种语言和二十年的竞赛,包含30,676道由专家编写并附解答的跨领域问题。除核心数据集外,我们还构建了一个由人类专家策划的、由数学等价与结构相似问题对组成的检索基准。MathNet支持三项任务:(i) 问题求解,(ii) 数学感知检索,(iii) 检索增强问题求解。实验结果显示,即使是最先进的推理模型(Gemini-3.1-Pro为78.4%,GPT-5为69.3%)仍受到挑战,而嵌入模型则难以检索到等价问题。我们进一步表明,检索增强生成的性能对检索质量高度敏感;例如DeepSeek-V3.2-Speciale取得最高达12%的提升,获得该基准上的最高分。MathNet提供了最大的高质量奥赛数据集以及首个评估数学问题检索的基准,并在https://mathnet.mit.edu公开发布数据集和基准。

MathNet:面向数学推理与检索的全球多模态基准:论文配图
图1:MathNet总览:汇集47国、17种语言、143项赛事40年间的3万余道奥赛级题目与专家解答,用于评估模型解题与数学检索能力。