论文

FormalProofBench:模型能写出经形式化验证的研究生水平数学证明吗?

FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?

智能体系统Agent任务评测

摘要

我们提出FormalProofBench,一个旨在评估AI模型能否产出经形式化验证的研究生水平数学证明的私有基准。每个任务将一道自然语言题目与一个Lean 4形式化陈述配对,模型必须输出能被Lean 4检查器接受的Lean证明。FormalProofBench面向高年级本科与研究生数学,题目取自资格考试与标准教材,涵盖分析、代数、概率与逻辑等主题。我们用智能体式评估框架(agentic harness)评估了一系列前沿模型,发现表现最好的基础模型准确率为33.5%,其后的模型性能迅速下滑。除准确率数字外,我们还提供了关于工具使用、失败模式、成本与延迟的实证分析,从而对前沿模型的形式化定理证明能力给出全面评估。

FormalProofBench:模型能写出经形式化验证的研究生水平数学证明吗?:论文配图
图4:各模型在200道题目上工具调用总数(搜索与代码执行)的汇总对比,显示不同模型的工具使用策略差异悬殊。