论文
经严格步级验证评估研究级数学证明
Evaluating Research-Level Math Proofs via Strict Step-Level Verification
摘要
大型语言模型 (LLM) 很难严格验证复杂的数学证明。标准的全球评估方法遭受“背景中毒”,即表面看似合理的陈述掩盖了微妙的逻辑缺陷,导致幻觉或过度怀疑。为了解决这个问题,我们从全局评估转向严格的步骤级验证:我们的框架为每个推导步骤维护详细的上下文,并严格限制应用定理的来源。我们对从 FirstProof 挑战中提取的精心策划的研究级证明的对抗性诊断套件进行评估。系统的消融研究表明,这些演绎约束是不可或缺的,因为不受约束的全局提示始终无法定位微妙的逻辑错误。除了超越全球评估之外,我们的方法从根本上改变了失败分类法。错误分析表明,剩余的拒绝并不是表现出严重的逻辑幻觉,而是主要是源于未声明的领域约定的“迂腐的超级严格”实例,有效地暴露了专家基准本身中隐含的模糊性。我们的研究结果表明,促使智能体以谨慎的、类似人类数学家的方式组织验证笔记,可以大大提高他们区分严格证明和有缺陷的证明的能力,有可能加强对基本模型尚不熟悉的前沿数学概念的智能体推理,并为未来的自动证明审查系统奠定理论基础。代码和提示可在 GitHub 上找到。