论文
AdvancedMathBench:高级数学证明生成和验证的基准套件
AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification
摘要
大语言模型 (LLM) 在高中和竞赛级别的数学方面取得了出色的成绩,但他们在高等数学方面的能力仍然知之甚少。然而,现有的基准在范围和评估粒度上都存在不足:它们提供的学科覆盖范围有限,并且往往依赖于最终答案的正确性或粗略的判断,从而导致推理过程的有效性评估不充分。为了弥补这一差距,我们引入了 AdvancedMathBench,这是一个基准套件,旨在评估 LLM 在高级数学证明上的推理能力。其核心生成基准 ProverBench 包含涵盖本科 (UG) 和博士资格考试 (QE) 级别的 245 个问题。为了可靠地评估这些证明,我们开发了一个专用的自动验证管道,该管道经过大规模专家注释的训练,生成正确性判决和细粒度分析,并在保留的证明轨迹上与人类专家表现出强烈的一致性。我们进一步引入了 VerifierBench,由 888 个模型生成的证明轨迹组成,并与专家 真值 配对,以评估模型是否能够正确判断证明有效性并提供合理的验证依据。实验表明,AdvancedMathBench 对于前沿模型仍然具有挑战性。在证明生成方面,性能最好的模型 GPT-5.5-xhigh 在 UG 和 QE 分割上分别仅获得 64.5 和 48.9。在证明验证中,最好的模型仅达到 65.1 的平衡 F1。进一步的分析揭示了跨模型的证明生成和验证功能之间存在显着的不匹配。