论文
LEAP:以智能体框架为形式数学超级充能LLM
LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks
摘要
大型语言模型 (LLM) 表现出强大的非正式数学推理能力,但很难用 Lean 等正式语言生成可机械验证的证明。我们提出了 LEAP,一种代理框架,使通用基础模型能够在自动化形式定理证明方面实现最先进的性能。 LEAP 利用基础模型功能,例如非正式推理、指令遵循和迭代自我完善。通过将复杂的问题分解为更小的单元,系统通过与Lean编译器的持续交互,将正式的证明构造与非正式的蓝图联系起来。为了提供超越日益饱和的基准的严格评估,我们引入了 Lean-IMO-Bench,这是一种以Lean形式化的 IMO 风格问题的基准,具有简短的陈述,但在各种难度级别上都具有高度非常规和多步骤的证明。根据经验,在最新的 2025 年普特南竞赛(北美一年一度的本科生数学竞赛)上,LEAP 解决了全部 12 个问题,与前沿形式数学模型的最新突破相匹配。在 Lean-IMO-Bench 上,LEAP 将通用 LLM 的一次性正式解决率从低于 10% 提高到 70%,显着超过了专门的金牌级 IMO 系统设定的 48% 基准。此外,我们通过自动形式化开放组合挑战的复杂证明来展示 LEAP 的研究级实用性,包括偶数阶凯莱图 Knuth 哈密顿分解中关键子问题的验证证明。
