论文

评估大语言模型在低代表性数学竞赛题目上的推理能力

Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems

模型评测模型能力评测

摘要

理解大语言模型(LLM)在数学推理中的局限性是近期多项研究的焦点。然而,这些研究大多使用相同的数据集进行基准测试,这限制了其结论的泛化性,也可能无法完全捕捉数学任务中存在的多样化挑战。本研究旨在分析 LLM 在低代表性数学竞赛题目上的表现。我们用密苏里大学生数学竞赛(Missouri Collegiate Mathematics Competition)中微积分、解析几何与离散数学领域的题目提示三个领先的 LLM,即 GPT-4o-mini、Gemini-2.0-Flash 和 DeepSeek-V3,然后将 LLM 的回答与已知正确解答进行比对,以确定 LLM 在每个题目领域的准确性。我们还分析了 LLM 的推理过程,以探索不同题型和模型之间的错误模式。DeepSeek-V3 在微积分、解析几何和离散数学三个类别中均表现最佳,无论推理还是正确的最终答案都是如此。三个 LLM 在几何方面都表现出明显薄弱的性能。DeepSeek-V3 所犯的大多数错误归因于计算和逻辑失误,而 GPT-4o-mini 则经常表现出逻辑和方法选择方面的错误。相比之下,Gemini 往往在推理不完整和草率下结论上遇到困难。总之,在低代表性数学竞赛数据集上评估 LLM 可以更深入地洞察其独特的错误模式,并凸显结构化推理方面依然存在的挑战,尤其是在几何领域。

评估大语言模型在低代表性数学竞赛题目上的推理能力 配图
图 1:数学推理任务上的模型评估。(a) 答案正确且推理正确的百分比。(b)–(d) 分别为微积分、几何与离散数学问题中错误推理类型的分析。