论文

Mask-Proof:基于LLM的数学证明自动化数据策展管线

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

模型评测基准与评测资源

摘要

大型语言模型(LLM)解决数学问题的能力越来越强,甚至可以协助研究级证明,但我们仍然缺乏一种可扩展且可重复的方法来衡量跨不同来源的长证明中的步骤级推理。这种评估差距限制了值得信赖的人工智能对经过证明的科学进步的帮助。现有的评估通常强调最终答案或依赖昂贵的专家评分,而端到端的证明生成仍然是开放式的并且难以自动验证。我们引入了 Mask-Proof,这是一种将真实证明转化为可自动检查的屏蔽步骤任务的管道。它掩盖了关键的公式步骤,提供了必要的周围环境,并使用基于 LLM 的等价判断来评估模型重建,并使用重复投票来确保稳定性。由此产生的 Mask-ProofBench 包含跨越不同研究领域的 292 个精选问题。对 17 个模型的实验表明,推理增强模型的性能比标准模型高 12% 到 27%。我们的评估者与专家注释者达成了 96.8% 的一致性,从而实现了对步骤级数学推理的忠实、可重复和可比较的测量。基准、注释和代码可在 https://github.com/weating/Mask-Proof 获取。

Mask-Proof:基于LLM的数学证明自动化数据策展管线:论文配图
图 2.防掩模管道。从原始 arXiv LaTeX 源开始,我们的管道提取完整的证明,将它们修复到独立的上下文中,并代理屏蔽关键公式步骤以生成 Mask-ProofBench。Mask-Proof 管道概述图该管道分为三个阶段。第一阶段,论文收集:下载带有 LaTeX 源的 arXiv 论文并筛选为候选证明。第二阶段,自动化数据管理,包含两个子模块: 自包含恢复,其中 Codex CLI 采用非自包含问题和原始 LaTeX 源,并解析依赖关系以生成与证明配对的自包含问题; Agentic Masking for Proof,其中 Codex CLI 选择关键公式步骤,将其替换为 MASK 令牌,并将屏蔽内容记录为基本事实,同时过滤掉琐碎的步骤。第三阶段,Mask-ProofBench 和评估:由多个 LLM 评估生成的基准实例,并且 Mask-Proof Judge 评估模型输出与真实屏蔽内容之间的语义等价性。