论文
Mask-Proof:基于LLM的数学证明自动化数据策展管线
Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs
摘要
大型语言模型(LLM)解决数学问题的能力越来越强,甚至可以协助研究级证明,但我们仍然缺乏一种可扩展且可重复的方法来衡量跨不同来源的长证明中的步骤级推理。这种评估差距限制了值得信赖的人工智能对经过证明的科学进步的帮助。现有的评估通常强调最终答案或依赖昂贵的专家评分,而端到端的证明生成仍然是开放式的并且难以自动验证。我们引入了 Mask-Proof,这是一种将真实证明转化为可自动检查的屏蔽步骤任务的管道。它掩盖了关键的公式步骤,提供了必要的周围环境,并使用基于 LLM 的等价判断来评估模型重建,并使用重复投票来确保稳定性。由此产生的 Mask-ProofBench 包含跨越不同研究领域的 292 个精选问题。对 17 个模型的实验表明,推理增强模型的性能比标准模型高 12% 到 27%。我们的评估者与专家注释者达成了 96.8% 的一致性,从而实现了对步骤级数学推理的忠实、可重复和可比较的测量。基准、注释和代码可在 https://github.com/weating/Mask-Proof 获取。
