GTBench:课程锚定的图论数学研究助手LLM评估基准
GTBench: A Curriculum-Grounded Benchmark for Evaluating LLMs as Mathematical Research Assistants in Graph Theory
摘要
大型语言模型(LLM)越来越多地被用作技术学科的自学助手,但它们作为数学推理助手的可靠性仍然知之甚少。我们引入了GTBench,这是一个以课程为基础的基准,用于评估大语言模型作为图论数学研究助理,包括 63 个问题,分为难度逐渐增加的三组:本科生定义和基本属性(第 1 组)、算法跟踪和结构推理(第 2 组)以及研究生水平的证明构造(第 3 组)。问题来源于经过验证的学术材料,包括迪斯特的图论。我们在零样本和思维链提示下评估了五个前沿模型——GPT-5、Claude Sonnet 4.6、Gemini 2.5 Flash-Lite、Llama 3.3 70B 和 Mistral Large 3,对第 1 组和第 2 组使用精确匹配和大语言模型作为评判评估,对第 3 组使用混合人类专家和大语言模型作为评判协议。我们的结果揭示了明显的性能等级: GPT-5 在第 1 组(95.8% 零样本)上接近上限,并在研究生证明上保持有意义的准确性(82%),而所有其他模型都在困难中大幅退化,Llama 在第 3 组零样本的人类评估下实现了 0%。故障模式分析表明,正确的算法、错误的执行错误在第 1 组和第 2 组中占主导地位,而第 3 组还出现了不完整的推理失败,并揭示了人类评估者和自动判断者之间的系统性分歧,特别是在详细或接近完整的证明方面(人类对的 kappa = 0.48-0.83)。 GTBench 为大语言模型的图论推理提供了第一个基于课程的评估框架,对数学教育和科学研究中人工智能工具的治理具有直接影响。
