模型

LongCat-Flash-Prover 开源:MiniF2F-Test 97.1%(72 次预算)

LongCat-Flash-Prover:AI 攻克数学定理证明,不仅要“算得对”,更要“证得严”

应用与实践模型架构模型训练模型推理智能体系统AI 基础设施MoE强化学习推理搜索与路径规划Agent 工具调用模型部署科学研究Agentic RL

概述

LongCat-Flash-Prover 面向 Lean4 形式化定理证明,把推理拆成三个原子能力:自动形式化(Auto-Formalization,把自然语言题目翻译为 Lean4 形式化描述)、草稿生成(Sketching,把大定理拆成若干待证 Lemma 与 Main Body)、证明生成(Proving,沿草稿补全细节)。训练采用结合工具集成推理(TIR)的“混合专家迭代”框架:Cold-Start 阶段用团队早期基于 TIR 与 DPO 训练的 Auto-Formalizer 专有模型 ATF-32B 合成 Formal Statement,再由 LongCat-Flash-Thinking-2601 生成带 Lean4 验证工具反馈的高质量轨迹,经去污、去重与按难度和多样性采样后,用领域混合 SFT 整合不同模型族的能力得到冷启动模型;Iteration 阶段以冷启动模型为新专家继续合成轨迹并混入大量通用数据,每轮做 SFT 与 RL 多轮迭代得到最终模型。课程学习上先单轮后多轮调工具、先完整证明后引理式草稿证明。配套四类智能体工具:Lean4 Server(把完整 Proof 插入锚点直接指出错误代码片段,而非行列坐标)、语义一致性(LLM-as-Judge 校验 Formal Statement 与原始问题语义一致)、Theorem 一致性(基于规则禁止篡改证明目标)、Legality 验证(用轻量级 Lean4 词法语法分析器转 AST,排查约 9 种作弊手段:修改 Formal Statement、插入提前终止符 #exit、插入不存在的公理、用 macro/elab/syntax/notation 绕过编译等)。RL 阶段基于 LongCat-Flash-Thinking 使用的 DORA 框架,在 TIR 模式下训练,并针对 MoE 的训推不一致与 Staleness 引入分层策略:序列层面按所有 Token 的 IS Ratio 几何均值剔除超阈值序列的梯度、Token 层面剔除显著训推不一致的 Token、再对保留 Token 做标准 Clipping;损失从 Sequence-Mean-Token-Mean 调整为 Token-Mean。指标:MiniF2F-Test 仅用 72 次推理预算通过率 97.1%(已知开源 Prover 中 SOTA,TIR 带来最高 14% 提升);MathOlympiad-Bench 46.7%(180 次预算)、ProofNet 52.2%、ProverBench 70.8%、PutnamBench 41.5%(118 次预算);Auto-Formalization 在所有自动形式化基准上取得新最佳,MiniF2F-Test 与 ProofNet 上达 100%;相同计算预算下采用 Sketching 平均再提升约 10%。 团队将 LongCat-Flash-Prover 全面开源:GitHub https://github.com/meituan-longcat/LongCat-Flash-Prover 提供代码,HuggingFace https://huggingface.co/meituan-longcat/LongCat-Flash-Prover 提供模型权重,技术报告 PDF 为 https://github.com/meituan-longcat/LongCat-Flash-Prover/blob/main/LongCat_Flash_Prover_Technical_Report.pdf;正文开头与文末两次列出上述入口,研究与开发者可直接获取模型与完整技术报告。