论文

超越基准:MathArena 作为 LLM 的数学评估平台

Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs

模型评测基准与评测资源

摘要

大语言模型 (LLM) 正在成为越来越有能力的数学合作者,但静态基准已不足以评估进展:它们通常范围狭窄、很快饱和并且很少更新。这使得可靠地比较模型和跟踪一段时间内的进展变得困难。相反,我们需要评估平台:持续维护的系统,可以跨多个基准运行、聚合和分析评估,以全面了解广泛领域内的模型性能。在这项工作中,我们以原始 MathArena 基准为基础,将其范围从最终答案的奥林匹克问题扩大到使用 LLM 进行数学推理的持续维护评估平台。 MathArena 现在涵盖了更广泛的任务,包括基于证明的竞赛、研究级 arXiv 问题以及精益中的正式证明生成。此外,我们为所有模型维护一个明确的评估协议,并随着模型能力的提高定期设计新的基准,以确保 MathArena 保持挑战性。值得注意的是,最强的模型 GPT-5.5 目前在 2026 年美国数学奥林匹克竞赛中达到了 98%,在研究级问题上达到了 74%,这表明前沿模型现在可以轻松解决极具挑战性的数学问题。这凸显了像MathArena这样持续维护的评估平台对于跟踪LLM在数学推理方面的快速进展的重要性。