论文
LLM在Lean数学形式化中的评估
Evaluation of LLMs for Mathematical Formalization in Lean
摘要
在过去的几年里,大型语言模型(LLM)生成形式数学证明的能力得到了显着提高。我们对各种大语言模型在Lean 4 中生成正式证明的有效性进行了比较,目的是帮助那些寻求使用大语言模型来支持自己项目的人。我们利用 pass@$k$ 和细化@$k$ 指标作为我们对 miniF2F 和 miniCTX 数据集的子集进行比较和评估的基准。我们的测试表明,总体而言,Gemini 3.1 Pro 和 Claude Opus 4.7 表现最佳。 Gemini 3.1 Pro通过refine@32在miniF2F上实现了92%的成功率,而Opus 4.7通过refine@32在miniCTX上实现了86%的成功率。考虑到成本时,NVIDIA Nemotron 3 Super 和 GPT-OSS 120B 是最高效的,具有具有竞争力的精度,每个正确证明的平均成本为 $<\$0.01$。
