论文
FormalProofBench:模型能写出经形式化验证的研究生水平数学证明吗?
FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?
摘要
我们提出FormalProofBench,一个旨在评估AI模型能否产出经形式化验证的研究生水平数学证明的私有基准。每个任务将一道自然语言题目与一个Lean 4形式化陈述配对,模型必须输出能被Lean 4检查器接受的Lean证明。FormalProofBench面向高年级本科与研究生数学,题目取自资格考试与标准教材,涵盖分析、代数、概率与逻辑等主题。我们用智能体式评估框架(agentic harness)评估了一系列前沿模型,发现表现最好的基础模型准确率为33.5%,其后的模型性能迅速下滑。除准确率数字外,我们还提供了关于工具使用、失败模式、成本与延迟的实证分析,从而对前沿模型的形式化定理证明能力给出全面评估。
